GPT
G

granite-embedding-107m-multilingual

קוד פתוח

ibm-graniteapache-2.02024-12-04

  • transformers
  • pytorch
  • onnx
  • safetensors
  • xlm-roberta

מודל וקטורי רב-לשוני קומפקטי במיוחד, שמתאים למי שרוצה להריץ חיפוש סמנטי מקומי ומהיר בלי להחזיק שרת כבד וחשבון ענן מנופח.

  • 107Mפרמטרים
  • 514טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 78,028הורדות בחודש

מה זה

מדובר במודל וקטורי מבוסס ארכיטקטורת XLMRobertaModel עם 6 שכבות בלבד וכ־107 מיליון פרמטרים, גודל זעיר שמכוון למהירות ולא לדיוק מוחלט. הוא עובד בדיוק של bfloat16 ותומך בשפות רבות בהן אנגלית, ערבית, ספרדית, צרפתית, גרמנית, הולנדית, פורטוגזית, צ'כית, איטלקית, יפנית, קוריאנית וסינית.

במבחני MTEB הוא מציג תוצאות מעורבות שתואמות את מידותיו. באיתור קוד פייתון לפי טקסט במבחן COIR הוא מפתיע לטובה עם ציון nDCG@10 של 84.4, ובמשימת דירוג מחדש של שאלות טכניות מ־AskUbuntu הגיע ל־MAP של 61.9. מצד שני, במשימות אחזור כלליות מורכבות יותר כמו AppsRetrieval הוא קרס עם nDCG@10 של 4.537 בלבד, ובסיווג ביקורות מוצרים מאמזון עמד על 36.41 אחוזי דיוק. הפער הזה ממחיש שהוא עובד סביר למשימות קצרות וממוקדות, אך מתקשה מאוד באחזור מורכב או בהבנת טקסטים עמוסים.

מתאים ל

  • חיפוש קטעי קוד

    משיג תוצאה של 84.4 ב־nDCG@10 עבור פייתון, מה שהופך אותו לפתרון קל ומהיר למנועי חיפוש פנימיים למפתחים.

  • דירוג שאלות טכניות

    מתאים לזיהוי שאלות כפולות בפורומים לפי ציון MRR של 77.0 ב־AskUbuntu, תוך שמירה על זמני תגובה אפסיים.

  • אחזור רב-לשוני מקומי

    רץ ישירות על מעבד מקומי עבור טקסטים קצרים בשפות אירופיות ואסייתיות מרכזיות, ללא תלות בחיבור חיצוני.

איפה זה נופל

עברית לא נכללת ברשימת השפות הנתמכות, ולכן לא הייתי בונה עליו לשום יישום שמיועד לטקסט מקומי. בנוסף, חלון ההקשר מוגבל ל־514 טוקנים בלבד, מה שפוסל אותו לחלוטין מניתוח מסמכים מלאים, מאמרים או קבצי קוד ארוכים. ציוני האתרגון והאחזור המקצועי שלו נמוכים מאוד, וכפי שעולה ממבחני האפליקציות, הוא מפספס בקלות כשהשאילתה לא תואמת באופן ישיר את מבנה התשובה.

שאלות
נפוצות

האם המודל מתאים לשימוש בעברית?

לא. עברית אינה מופיעה ברשימת השפות הנתמכות בכרטיס המודל, והוא אומן על שפות כמו אנגלית, ערבית, גרמנית, צרפתית, ספרדית, יפנית וסינית בלבד. הפעלתו על טקסט עברי תביא לייצוג וקטורי לא מדויק ואינה מומלצת.

איזו חומרה צריך כדי להריץ אותו בייצור?

המודל כולל רק 107 מיליון פרמטרים ושוקל 1.3 ג'יגה-בייט בסך הכול. מעבד שרת סטנדרטי מסוגל להריץ אותו בקלות עם זמני תגובה מהירים, ואין שום צורך להשקיע בכרטיסי מסך יקרים.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.3 ג'יגה-בייט, כך שאפשר להריץ אותו ישירות דרך ספריית transformers על גבי כל מעבד מודרני ממוצע או על כרטיס גרפי בסיסי ביותר בלי להרגיש עומס בזיכרון. אין צורך בתשתית ייעודית, במכונות יקרות או בחלוקה לכמה מעבדים.

אם כל מה שאתם צריכים זה לחפש בקטלוג קטן או לקטלג משפטים קצרים בכמה שפות נתמכות, ההרצה העצמית פשוטה, חסכונית ולא דורשת שום תלות בחיבור רשת. לעומת זאת, אם הנתונים כוללים טקסטים ארוכים, דורשים דיוק גבוה באחזור מסמכים מורכבים או שאתם זקוקים לתמיכה בעברית, עדיף לפנות ל־API חיצוני של מודל עמוק בהרבה במקום להיאבק במגבלות הנפח שלו.

from transformers import pipeline

pipe = pipeline("sentence-similarity", model="ibm-granite/granite-embedding-107m-multilingual")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0, שמאפשר שימוש חופשי לצרכים מסחריים ופרטיים, כולל שינוי הקוד והפצה מחדש כחלק ממוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗