GPT
J

jina-embeddings-v3

קוד פתוח

jinaaicc-by-nc-4.02024-09-05

  • transformers
  • pytorch
  • onnx
  • safetensors
  • feature-extraction

יש כאן גם סקירה על Jina AI עצמו.

מודל וקטורי רב לשוני מבוסס XLM-RoBERTa, שתומך בעברית ודוחס טקסטים של עד 8,194 טוקנים ישירות לתוך וקטור חיפוש מדויק.

  • 572Mפרמטרים
  • 8,194טוקנים בהקשר
  • 5.4 GBמשקל הקבצים
  • 2,290,850הורדות בחודש

מה זה

במקום לחתוך מאמרים ארוכים לפסקאות קטנות, המודל הזה מעבד מסמכים שלמים של מעל שמונת אלפים טוקנים בזכות ארכיטקטורת XLMRobertaModel עם 24 שכבות ודיוק bfloat16. הוא שוקל 572 מיליון פרמטרים, גודל שמאפשר לו להחזיק רמת דיוק גבוהה בלי לדרוש שרתים מנופחים. הוא כולל תמיכה מובנית ברשימה עצומה של שפות, כולל עברית, יידיש וערבית.

במבחני אחזור מידע של MTEB בפולנית הוא מציג תמונה ברורה. במשימות מסוג ArguAna הוא מחזיר דיוק NDCG של 50.1 בטופ 10 ותופס שמונים אחוז מהתוצאות הרלוונטיות, אבל במאגרי ידע כמו DBPedia הדיוק נופל ל־34.8. משימות של דמיון סמנטי טהור מציגות ציוני מתאם ספירמן של 43.4 בלבד, מה שמלמד שהחוזק העיקרי שלו נמצא באחזור מידע קלאסי ולא בהשוואה מופשטת בין משפטים בודדים.

מתאים ל

  • חיפוש מסמכים ארוכים

    חלון של 8,194 טוקנים מאפשר להמיר חוזים, מאמרים ותקנונים לווקטור אחד בלי לחתוך אותם לפירורים.

  • מערכות אחזור רב לשוניות

    תמיכה בעשרות שפות כולל עברית מאפשרת לבנות אינדקס חיפוש שמתמודד עם טקסט מעורב.

  • שלב ראשון במנוע חיפוש

    שליפת עשרות תוצאות ראשוניות במהירות גבוהה בזכות recall של שמונים אחוז בטופ עשר במבחני שליפה.

איפה זה נופל

הנקודה החלשה ביותר מתגלה בציוני הדמיון הסמנטי, שעומדים על 43.4 בלבד במבחני STS, נתון בינוני למדי לקטגוריה הזו. בנוסף, למרות שהמודל מסומן כתומך בעברית, תוצאות הבדיקה הרשמיות שמפורטות בכרטיס נמדדו על שפות אחרות כמו פולנית וסינית, כך שחובה לבחון את הביצועים מול דאטה מקומי לפני שמסתמכים עליו. משימות אחזור מורכבות שמצריכות דיוק מדויק בתוצאה הראשונה הניבו MAP נמוך של 7.04 בבסיסי ידע מסוימים.

אותה משפחה

jina-embeddings יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה במוצר מסחרי?

לא. הרישיון המוגדר הוא CC-BY-NC-4.0, שאוסר מפורשות כל פעילות מסחרית. תצטרכו להגביל אותו למחקר או לפנות ליוצרים לרכישת רישיון מתאים.

האם המודל ירוץ טוב על מעבד רגיל בלי כרטיס מסך?

הוא ירוץ, אבל זה יהיה אטי מאוד. עם 572 מיליון פרמטרים וחלון הקשר גדול, מעבד סטנדרטי יתקשה לעבד טקסטים ארוכים בזמן סביר, ולכן מומלץ להשתמש ב־GPU עם לפחות 8 גיגה זיכרון.

איך מריצים

המשקל הכולל של הקבצים עומד על 5.4 גיגה בייט, כך שאפשר להריץ אותו בקלות על כרטיס מסך ביתי בודד עם 8 עד 12 גיגה זיכרון דרך ספריית transformers. בדיוק bfloat16 הוא רץ מהר ולא חונק את המשאבים, אבל עיבוד של טקסטים שמתקרבים לקצה חלון ההקשר דורש נפח זיכרון משמעותי יותר בזמן הריצה עצמה.

אם אתם בונים שירות שמעבד רק כמה עשרות מסמכים ביום, עדיף להשתמש בקריאות רשת לשירותי ענן חיצוניים ולחסוך תחזוקת שרתים. הרצה עצמאית שווה את ההשקעה רק כשיש לכם שטף קבוע של מידע, צורך בפרטיות מוחלטת של הנתונים, או כשאתם לא רוצים לשלם על כל קריאה.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="jinaai/jina-embeddings-v3")
print(pipe("שלום"))

הרישיון

הקוד והמשקולות מפורסמים תחת רישיון CC-BY-NC-4.0. המשמעות ברורה וחדה, אסור להשתמש במודל הזה בשום מוצר מסחרי, שירות בתשלום או פעילות שמניבה רווח. השימוש מוגבל למחקר, פיתוח פנימי והתנסות בלבד, אלא אם תסדירו רישיון נפרד מול היוצרים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗