GPT
V

voyage-4-nano

קוד פתוח

voyageaiapache-2.02026-01-06

  • sentence-transformers
  • safetensors
  • qwen3
  • text-generation
  • transformers

מודל שיכוך קטן במיוחד שחולק מרחב וקטורי מלא עם הדגמים הגדולים בסדרה שלו. הוא מאפשר לחפש ולפתח מקומית בלי לנעול אתכם לגודל יחיד.

  • 346Mפרמטרים
  • 40,960טוקנים בהקשר
  • 672 MBמשקל הקבצים
  • 292,036הורדות בחודש

מה זה

מדובר במודל וקטורי של כ־346 מיליון פרמטרים שמבוסס על הארכיטקטורה של Qwen3. המאפיין המשמעותי ביותר כאן הוא מרחב וקטורי משותף לכל סדרת Voyage 4. אפשר לאנדקס מסמכים עם הדגם הגדול ביותר בסדרה, ולבצע שאילתות בזמן אמת עם הדגם המזערי הזה בלי לאנדקס את המידע מחדש. לפי החברה הוא עוקף בביצועי אחזור מודלים קודמים וגדולים ממנו כמו voyage-3.5-lite.

בנוסף, הוא אומן בשיטת Matryoshka ומאפשר לחתוך את ממד הפלט מברירת המחדל של 2048 עד ל־256 בלבד. לצד זה יש תמיכה מובנית בקוונטיזציה ישירות מהקופסה, החל מ־float32 ועד ל־int8 או וקטורים בינאריים, מה שמוריד דרסטית את נפח האחסון והזיכרון בבסיס הנתונים הווקטורי שלכם.

מתאים ל

  • פיתוח מקומי ובדיקות

    וקטורים זהים לדגמים הגדולים, בלי תלות ברשת ובלי לשלם על קריאות API בזמן בדיקות.

  • שאילתות חיפוש מהירות

    זמן תגובה קצר וצריכת זיכרון מזערית בצד השרת, תוך שימוש בממדים חתוכים של 512 או 256.

  • אינדוקס בעלות אחסון נמוכה

    מעבר לוקטורים מסוג int8 או בינאריים ישירות מהמודל, לחסכון מקסימלי בנפח בסיס הנתונים.

איפה זה נופל

יש פער בדיווח על חלון ההקשר. המטא־דאטה מציין 40,960 טוקנים אבל גוף התיעוד מציין 32,000, ולכן כדאי לבדוק היטב איפה הוא נחתך בפועל לפני שדוחפים לו טקסטים ארוכים. נקודה קריטית נוספת היא שאי אפשר פשוט לזרוק אליו טקסט נקי. הוא דורש פרומפטים ייעודיים ונפרדים למסמכים ולשאילתות, ואם לא תקפידו עליהם דרך המתודות המובנות, דיוק השליפה ייפגע משמעותית.

שאלות
נפוצות

האם צריך לאנדקס מחדש אם נרצה לשדרג למודל גדול יותר?

לא. זו נקודת החוזק המרכזית שלו. כל סדרת Voyage 4 חולקת את אותו מרחב וקטורי, כך שאפשר לחפש עם הננו על מסמכים שאונדקסו בדגם הגדול.

איך משפיעה חיתוך הממדים על המודל?

הוא תומך ב־2048, 1024, 512 ו־256 ממדים באמצעות אימון Matryoshka ייעודי, שמתוכנן לצמצם את אובדן איכות האחזור כשמקצצים בגודל הווקטור.

איך מריצים

המשקל הכולל של הקבצים הוא 672 מגה־בייט בלבד בדיוק bfloat16, כך שאין שום צורך בחומרה ייעודית כבדה. כל מעבד מודרני במחשב נייד או כרטיס מסך בסיסי יריצו אותו בלי מאמץ באמצעות ספריית sentence-transformers או vllm.

ההרצה המקומית הגיונית בעיקר לפיתוח, למכשירי קצה, או לחיסכון בעלויות שאילתה בנפחים גבוהים. אם המוצר שלכם צריך לייצר וקטורים למסמכי ענק של אלפי טוקנים בקצב מהיר במיוחד, שרת ייעודי או קריאה לשירות מנוהל חיצוני עדיין יתנו ביצועי תפוקה עקביים יותר.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("voyageai/voyage-4-nano")
v = m.encode(["שלום עולם"])

הרישיון

המודל שוחרר תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והמשקלים והפצה פנימית או כחלק ממוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗