GPT
G

gte-multilingual-base

קוד פתוח

Alibaba-NLPapache-2.02024-07-20

  • sentence-transformers
  • safetensors
  • new
  • feature-extraction
  • mteb

מודל שיכוך וקטורי רב־לשוני של עליבאבא שמציע חלון הקשר חריג של 8,192 טוקנים בגודל בסיסי. מתאים למי שבונה חיפוש סמנטי למסמכים ארוכים במגוון שפות בלי לשלם על מודל ענק.

  • 305Mפרמטרים
  • 8,192טוקנים בהקשר
  • 600 MBמשקל הקבצים
  • 1,279,436הורדות בחודש

מה זה

המודל פותר בעיה מוכרת בארכיטקטורות חיפוש: רוב המודלים בגודל בסיס של כ־305 מיליון פרמטרים מוגבלים ל־512 טוקנים, מה שמחייב חיתוך אגרסיבי של טקסטים. כאן מקבלים חלון ארוך פי 16 שמאפשר להזין עמודים שלמים בלי פירוק מקדים, יחד עם תמיכה מוצהרת בעשרות שפות כולל עברית, ערבית ושפות אירופיות.

במדדי MTEB הוא מפגין ביצועים מעורבים שתלויים מאוד בסוג המשימה. במשימות אחזור עובדתי ממוקד כמו FEVER הוא מגיע לציון ndcg@10 של 92.11, ובכריית טקסט מקביל בין שפות שונות (BUCC) הוא מגרד את ה־98% בציון F1. מנגד, במשימות אחזור מורכבות יותר בעולם המשפטי כמו BSARD הוא צונח ל־26.11, ובחלק ממאגרי השאלות והתשובות הוא נע סביב ה־30, כך שהעומק הסמנטי שלו תלוי מאוד בדומיין.

מתאים ל

  • חיפוש סמנטי במסמכים ארוכים

    חלון של 8,192 טוקנים מאפשר לקלוט מאמרים ומסמכים שלמים בלי צורך לחתוך אותם לפסקאות קטנות.

  • אחזור מידע רב־לשוני למערכות RAG

    אינדוקס מאגרי ידע שכוללים שילוב של עברית, אנגלית ושפות נוספות תחת מודל וקטורי יחיד וקל משקל.

  • התאמת משפטים ותרגומים מקבילים

    ציוני ביטקסט של מעל 97% במבחני BUCC מראים יכולת חזקה בהתאמת טקסטים זהים בין שפות שונות.

איפה זה נופל

חלון ארוך הוא יתרון על הנייר, אבל בפועל מודל בגודל 305 מיליון פרמטרים מתקשה לשמור על דיוק סמנטי כשהטקסט מלא בפרטים מפוזרים. במבחני סיווג מסחריים כמו ביקורות באמזון הוא נע סביב 33% עד 43% דיוק בשפות שונות, תוצאה נמוכה שמראה שהוא מפספס ניואנסים עדינים או סנטימנט מורכב. כמו כן, למרות שעברית רשומה ברשימת השפות הנתמכות, הכרטיס אינו מציג מדדי ביצועים ייעודיים עבורה, ולכן חובה לבדוק את איכות התוצאות מול דאטה עברי אמיתי לפני שמשלבים אותו במערכת ייצור.

שאלות
נפוצות

האם המודל באמת תומך בעברית ברמה מספקת?

השפה he מופיעה ברשימת השפות הרשמית של המודל, אך המפתחים לא פירסמו תוצאות מדידה ספציפיות בעברית בתוך כרטיס המודל. המשמעות היא שהוא אומן על טקסט עברי, אך חובה לבצע בדיקת איכות עצמאית על הנתונים שלכם לפני שרצים איתו הלאה.

איזה חומרה מינימלית צריך בשביל להריץ אותו?

קבצי המודל שוקלים כ־600 מגה־בייט בדיוק float16, כך שמספיק כרטיס מסך בסיסי עם 4 גיגה זיכרון כדי לבצע היקשים בזמן אמת. עם זאת, אם תנצלו את מלוא חלון 8,192 הטוקנים, צריכת הזיכרון תעלה בזמן הריצה ותדרוש כרטיס גרפי מעט מרווח יותר.

איך מריצים

אתם טוענים אותו ישירות דרך הספרייה sentence-transformers בקוד פייתון קצר. עם משקל קבצים של כ־600 מגה־בייט בדיוק float16, אפשר להריץ אותו בקלות על כל מעבד גרפי מודרני עם זיכרון צנוע של 4 עד 8 גיגה, ואפילו על מעבד מרכזי רגיל אם קצב השאילתות שלכם נמוך. אין כאן צורך בתשתית שרתים כבדה או בחוות כרטיסים.

אם אתם שולחים טקסטים קצרים בלבד, מודלים קטנים וקלאסיים יעבדו מהר יותר. לעומת זאת, אם חלון ההקשר המלא של 8,192 טוקנים קריטי עבורכם אבל אתם מתעסקים עם עשרות מיליוני מסמכים ביום, החישוב של קשב ארוך עלול להאט את קצב היצירה, ובמצב כזה שווה לבדוק אם שירות מנוהל או גרסת שרת ייעודית כמו text-embeddings-inference זולה יותר לתחזוקה.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("Alibaba-NLP/gte-multilingual-base")
v = m.encode(["שלום עולם"])

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי של הקוד, הפצה והטמעה במוצרים פנימיים או חיצוניים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗