GPT
J

jina-embeddings-v5-text-small

קוד פתוח

jinaaicc-by-nc-4.02026-01-22

  • transformers
  • safetensors
  • jina_embeddings_v5
  • feature-extraction
  • mteb

יש כאן גם סקירה על Jina AI עצמו.

מודל שיכוך רב-לשוני קומפקטי שמגיע מזיקוק של מודל 4B לתוך בסיס קטן. הוא נותן חלון של 32K טוקנים ותומך בקוונטיזציה בינארית בלי לדרוש שרת מפלצתי.

  • 596Mפרמטרים
  • 32,768טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 276,351הורדות בחודש

מה זה

המודל הזה נשען על Qwen3-0.6B-Base ועבר זיקוק ישירות מ־Qwen3-Embedding-4B יחד עם אימוני ניגודיות למשימות ייעודיות. במבחני MTEB v2 באנגלית הוא מציג ציון ממוצע של 71.7 וב־MMTEB הרב-לשוני ציון של 67.7. המספרים האלה מציבים אותו בראש הקטגוריה שלו עבור מודלים שמתחת למיליארד פרמטרים, כלומר הוא מחלץ דיוק שקרוב למודלים כבדים בהרבה.

הוא תומך ביותר מ־119 שפות וכולל תמיכה מובנית ב־Matryoshka, כך שאפשר לחתוך את וקטור הפלט מממד ברירת המחדל של 1024 עד ל־32 בלבד כדי לחסוך מקום באחסון. התוצאה היא גמישות תשתיתית אמיתית, במיוחד אם אתם צריכים אינדוקס מהיר של טקסטים ארוכים בארכיטקטורות חיפוש או סיווג.

מתאים ל

  • חיפוש ואחזור מסמכים ארוכים

    חלון של 32K מאפשר לשכן מסמכים שלמים, חוזים ומאמרים ללא צורך בחיתוך אגרסיבי למקטעים קטנים.

  • מערכות וקטוריות דלות שטח

    התמיכה ב־Matryoshka ובקוונטיזציה בינארית מאפשרת לכווץ את הוקטור עד לממד 32 ולחסוך נפח בבסיס הנתונים.

  • סיווג וקיבוץ טקסט בריצת קצה

    משקל של 1.3 גיגה מאפשר להריץ משימות סיווג מקומיות בזול בלי לפנות לשרתי ענן מנופחים.

איפה זה נופל

למרות חלון של 32,768 טוקנים, ריצה מקומית על טקסטים באורך כזה תזלול זיכרון ותאט משמעותית את זמן התגובה בלי Flash Attention מוגדר כהלכה. בעיה מרכזית נוספת מגיעה מפיצול המשימות. כדי להוציא ממנו ביצועים גבוהים בכלי שרת כמו vLLM או ONNX, צריך לבחור מראש במשקלים ייעודיים לאחזור, סיווג או התאמת טקסט, במקום להשתמש במודל גנרי יחיד שעושה הכל באותו שירות. מעבר לזה, תמיכה ב־119 שפות לא מבטיחה איכות אחידה, וצריך לבדוק בפועל את האיכות בעברית במשימת היעד מול מודלים ייעודיים לפני שמסתמכים עליו.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בתוך מוצר מסחרי?

לא ישירות תחת הרישיון המקורי. המודל שוחרר ברישיון CC BY-NC 4.0 שחוסם שימוש מסחרי, כך שאם הפרויקט מייצר הכנסות או מיועד לחברה, צריך לפנות למפתחים ולהסדיר רישיון מסחרי ייעודי.

למה יש גרסאות נפרדות למשימות כמו אחזור וסיווג?

הגרסאות הייעודיות ממזגות את מתאמי ה־LoRA הספציפיים לתוך משקלי הבסיס. זה נעשה כדי לאפשר פריסה חלקה במנועים כמו vLLM ו־TEI שלא תמיד מסתדרים עם טעינה דינמית של מתאמים בזמן אמת.

האם חייבים לשמור וקטורים מלאים בגודל 1024?

ממש לא. המודל אומן בשיטת Matryoshka, מה שאומר שאפשר לחתוך את הוקטור לממדים מוגדרים מראש כמו 512, 256 ואפילו 32, בהתאם לדרישות הזיכרון והביצועים של המערכת שלכם.

איך מריצים

במשקל קבצים של 1.3 גיגה-בייט ודיוק bfloat16, המודל הזה רץ בקלות על כרטיס מסך בודד ברמת כניסה או תחנת עבודה צנועה. כדי להריץ אותו צריך transformers בגרסה 4.57.0 לפחות, PyTorch 2.8.0 ו־peft, ומומלץ מאוד להתקין flash-attention אם אתם מתכוונים לנצל את כל חלון ההקשר. הוא תומך גם ב־sentence-transformers ישירות מהקופסה.

למי שעובד עם סביבות ייעודיות כמו vLLM, TEI או ONNX, החברה הוציאה גרסאות נפרדות שבהן מתאמי המשימות כבר מוטמעים במשקלים לפי סוג העבודה: אחזור, התאמת טקסט, סיווג או קלסטרינג. אם אין לכם תשתית שרתים או שאתם בתוך Elastic, אפשר לצרוך אותו דרך Elastic Inference Service או ה־API של Jina במקום לנהל את המכונות לבד.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="jinaai/jina-embeddings-v5-text-small")
print(pipe("שלום"))

הרישיון

הרישיון הוא CC BY-NC 4.0. המשמעות פשוטה: מותר להשתמש בו למחקר, ניסויים אישיים ופרויקטים לא מסחריים בלבד, תחת מתן קרדיט מתאים. אסור לשלב אותו במוצר מסחרי, בשירות SaaS או בפעילות שמניבה כסף בלי לרכוש רישיון מסחרי נפרד ישירות מול Jina AI.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗