GPT
J

jina-embeddings-v5-text-nano

קוד פתוח

jinaaicc-by-nc-4.02026-01-22

  • transformers
  • safetensors
  • jina_embeddings_v5
  • feature-extraction
  • mteb

יש כאן גם סקירה על Jina AI עצמו.

מודל וקטורי זעיר שמזקק ביצועים של מודל 4B לתוך משקל נוצה. מתאים למי שחייב לרוץ מקומית על מעט מאוד זיכרון ולא מוכן לוותר על חלון הקשר ארוך.

  • 212Mפרמטרים
  • 8,192טוקנים בהקשר
  • 472 MBמשקל הקבצים
  • 120,649הורדות בחודש

מה זה

המודל מבוסס על EuroBERT-210m ועבר זיקוק מודלים מתוך Qwen3-Embedding-4B יחד עם למידה ניגודית ייעודית למשימות שונות. הוא מיועד למשימות אחזור, התאמת טקסט, קיבוץ וסיווג בשפות מרובות. במבחני MTEB באנגלית הוא קיבל ממוצע של 71.0, ובמבחן הרב לשוני MMTEB הוא עומד על 65.5, תוצאות שעוקפות מודלים מתחרים מתחת לטווח של חצי מיליארד פרמטרים כמו KaLM-mini-v2.5 ו־Gemma-300M.

המשמעות בפועל היא יכולת לדחוס את הווקטורים לגדלים שונים בין 32 ל־768 ממדים בשיטת מטריושקה, או לבצע קוונטיזציה בינארית בלי לפרק את הדיוק של החיפוש. חלון ההקשר שלו מגיע עד 8,192 טוקנים לפי המפרט הטכני, מה שמאפשר לאנדקס מסמכים שלמים בלי לחתוך אותם לפילוחים קטנים מדי.

מתאים ל

  • אחזור מידע על מעבדים זולים

    משקל של פחות מחצי גיגה מאפשר להריץ מנוע חיפוש מקומי על שרתים פשוטים בלי להחזיק כרטיס מסך יקר.

  • אחסון וקטורי מכווץ

    תמיכה בממדי מטריושקה וקוונטיזציה בינארית שומרת על דיוק סביר גם כשחותכים את גודל האינדקס בצורה קיצונית.

  • אינדוקס מסמכים באלסטיק

    השתלבות מובנית בשירות Elastic Inference Service מאפשרת להפיק וקטורים ישירות בתוך פריסת הנתונים הקיימת.

איפה זה נופל

הטקסט הרשמי סותר את עצמו לגבי אורך ההקשר, כאשר בטבלה מופיע חסם של 8,192 טוקנים ובפסקה נכתבה תמיכה של עד 32K, כך שמומלץ לבדוק את הגבול בפועל לפני שמזינים טקסטים ארוכים במיוחד. מעבר לכך, התמיכה בשפות מרובות מבוססת על EuroBERT וזיקוק מודל סיני, ולכן איכות הייצוג בעברית אינה מובטחת ודורשת בדיקה מעשית על הדאטה שלכם. בעיה תפעולית נוספת היא הצורך להחליף מודל או מתאם נפרד לפי המשימה שלכם במקום להשתמש במודל יחיד ופשוט.

שאלות
נפוצות

האם המודל מתאים לשימוש מסחרי באפליקציה שלי?

לא באופן ישיר. רישיון המודל הוא CC BY-NC 4.0 המיועד לשימוש לא מסחרי בלבד. כדי להכניס אותו למערכת שמייצרת רווחים יש ליצור קשר עם Jina AI ולקבל רישיון מתאים.

איך כדאי להריץ אותו כדי לקבל את הביצועים הטובים ביותר?

להרצה מקומית מומלץ להתקין את ספריית flash-attention ולבחור בגרסה הייעודית למשימה שלכם, למשל גרסת retrieval עבור מנועי חיפוש. אם המערכת מבוססת על Elasticsearch, אפשר להשתמש בחיבור המובנה ל־Elastic Inference Service בלי לנהל שרתים.

איך מריצים

במשקל קבצים של 472 מגה בייט, המודל הזה רץ כמעט על כל דבר. אפשר להריץ אותו ישירות על מעבד רגיל של שרת פשוט, במחשב נייד או על כרטיס מסך בסיסי מאוד, בלי צורך במערכי GPU יקרים. דרישות הקוד מחייבות סביבת פייתון עם transformers מגרסה 4.57.0 ומעלה, torch מגרסה 2.8.0 וספריית peft.

למי שרוצה ביצועים מהירים בכלי שרת כמו vLLM, llama.cpp או ONNX, המפתחים יצרו גרסאות נפרדות שבהן המתאמים מוטמעים ישירות במשקולות עבור כל משימה. אם אין לכם כוח לנהל תשתית והתקנות שרתים, אפשר להשתמש בו ישירות כשירות מנוהל דרך Elastic Inference Service או לגשת ישירות אל ה־API של Jina AI.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="jinaai/jina-embeddings-v5-text-nano")
print(pipe("שלום"))

הרישיון

הרישיון הוא CC BY-NC 4.0, מה שאומר שהוא חינמי אך ורק לצרכי מחקר, פיתוח פנימי ושימוש לא מסחרי. אי אפשר לשלב אותו במוצר שמייצר הכנסות, באפליקציה בתשלום או כחלק משירות מסחרי בלי לפנות אל החברה ולרכוש רישיון מסחרי ייעודי.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗