GPT
J

jina-embeddings-v2-base-en

קוד פתוח

jinaaiapache-2.02023-09-27

  • sentence-transformers
  • pytorch
  • coreml
  • onnx
  • safetensors

יש כאן גם סקירה על Jina AI עצמו.

מודל וקטורי קל משקל שמיועד לטקסטים ארוכים באנגלית בלי לחתוך אותם לחתיכות קטנות. הוא פותר את בעיית הזיכרון הקצר של מודלים סטנדרטיים ומחזיר ייצוג מלא למסמכים שלמים.

  • 137Mפרמטרים
  • 8,192טוקנים בהקשר
  • 2.0 GBמשקל הקבצים
  • 324,894הורדות בחודש

מה זה

הייחוד המרכזי כאן הוא היכולת לבלוע עד 8,192 טוקנים בבת אחת, בניגוד לרף הרגיל של 512 שמאפיין מודלים דומים בגודל של כ־137 מיליון פרמטרים. המבנה שלו מבוסס על ארכיטקטורת JinaBert עם 12 שכבות, והוא אומן על מאגר c4 כדי לייצר וקטורים למשימות אחזור, סיווג ודמיון סמנטי.

במבחני MTEB הוא מציג תמונה מעורבת שתלויה מאוד באופי המשימה. בסיווג קוטביות בסיסי הוא מגיע לדיוק של מעל 88 אחוזים, אבל במשימות מורכבות יותר כמו דירוג ביקורות באמזון הדיוק צונח לאזור ה־45 אחוז בלבד. באחזור מידע מבוסס שאלות ותשובות, כמו מבחני CQADupstack השונים, המדדים מראים שהוא מחזיר את התשובה הנכונה בתוך עשר התוצאות הראשונות בחלק ניכר מהמקרים, אך הדיוק של התוצאה הבודדת הראשונה נשאר סביב 20 עד 40 אחוז.

מתאים ל

  • אחזור מסמכים ארוכים

    מייצר וקטור לעמודים שלמים של מאמרים ודוחות באנגלית בלי צורך לחלק אותם לפסקאות נפרדות.

  • סינון ודמיון שאלות

    מזהה שאלות כפולות בפורומים טכניים, כפי שמוכיח ציון MRR של כ־75 אחוז במבחן AskUbuntu.

  • סיווג טקסטים כלליים

    מבדיל בין סנטימנט חיובי לשלילי בטקסטים אנגליים עם דיוק של מעל 88 אחוזים.

איפה זה נופל

החיסרון הברור ביותר הוא השפה, המודל אומן לאנגלית בלבד, וכל ניסיון להזין לו עברית יניב תוצאות חלשות ווקטורים לא מדויקים. בנוסף, מבחני הביצועים מראים חולשה בולטת בתחומים טכניים ספציפיים, למשל במבחן CQADupstack Mathematica שבו מדד הדיוק הממוצע מגיע ל־15 אחוז בלבד בתוצאה הראשונה. אם אתם בונים מנוע חיפוש לקוד או למתמטיקה, הוא עלול לאכזב.

שאלות
נפוצות

האם המודל מתאים לחיפוש סמנטי של טקסטים בעברית?

לא, המודל הזה תומך באנגלית בלבד ואומן על דאטה ייעודי באנגלית. ניסיון להשתמש בו לטקסט עברי יוביל לביצועים גרועים ולא מומלץ לשלב אותו במוצר שמיועד לשוק המקומי ללא אימון נוסף.

האם אני חייב כרטיס מסך יקר כדי להריץ אותו?

לא, המודל שוקל 2.0 גיגה בייט בלבד ומכיל 137 מיליון פרמטרים. כרטיס מסך פשוט או אפילו מעבד רגיל יספיקו, אם כי מסמכים ארוכים מאוד של אלפי טוקנים יעבדו לאט יותר על מעבד.

איך מריצים

טוענים את המודל ישירות דרך ספריית sentence-transformers הרגילה בפייתון, והקבצים שלו שוקלים שני ג'יגה בייט בדיוק float32. כל כרטיס מסך בסיסי עם 4 עד 6 ג'יגה בייט של זיכרון יחזיק אותו בקלות, ואפשר להריץ אותו אפילו על מעבד מרכזי אם קצב השאילתות נמוך, אם כי עיבוד מסמכים שלמים באורך המרבי של 8,192 טוקנים ייקח זמן וידרוש יותר זיכרון עבודה.

משתלם להריץ אותו לבד אם אתם בונים שרת אחזור פנימי שצריך לעבד כמויות גדולות של מסמכים באופן קבוע, בלי לשלם על כל קריאה ובלי להוציא מידע רגיש החוצה. לעומת זאת, אם השימוש שלכם הוא נקודתי או שאתם מחפשים תמיכה בריבוי שפות ושליטה בתשתיות ענן בלי לתחזק שרתים, פנייה לפתרון מנוהל תחסוך את כאב הראש התפעולי.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("jinaai/jina-embeddings-v2-base-en")
v = m.encode(["שלום עולם"])

הרישיון

הוא מופץ תחת רישיון Apache 2.0 שמאפשר שימוש מסחרי חופשי לחלוטין. מותר לשלב אותו בתוך מוצר סגור, לשנות את המשקלים או להריץ אותו כחלק מצינור עיבוד נתונים פנימי בארגון. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי בקבצי הפרויקט שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗