GPT
G

granite-embedding-97m-multilingual-r2

קוד פתוח

ibm-graniteapache-2.02026-04-20

  • sentence-transformers
  • onnx
  • safetensors
  • openvino
  • modernbert

מודל וקטורי קומפקטי שמביא חלון הקשר ענק ותמיכה רחבה בשפות. הוא מיועד למי שצריך חיפוש טקסט מהיר וזול במיוחד בלי לחנוק את השרת.

  • 97Mפרמטרים
  • 32,768טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 97,282הורדות בחודש

מה זה

מדובר במודל וקטורי דחוס שמייצר וקטורים בגודל 384 ממדים ומבוסס על ארכיטקטורת ModernBERT. הוא נוצר מתוך חיתוך שכבות וצמצום מילון של אחיו הגדול בעל 311 מיליון הפרמטרים, יחד עם תהליך זיכוך ידע כדי להחזיר את הדיוק שאבד. השילוב של מודל קטן עם חלון הקשר של 32,768 טוקנים די נדיר בקטגוריה הזו, שבה רוב המודלים הוותיקים נעצרים בטווחים קצרים בהרבה.

במדדי השליפה הרב-לשוניים של MTEB הוא מקבל ציון 60.3, פער של 9.4 נקודות מעל מודל פופולרי מקביל כמו multilingual-e5-small. בפועל זה אומר שהוא מזהה קשרים סמנטיים בשאילתות מורכבות ברמה שמזכירה מודלים כבדים פי שלושה, לצד תמיכה מפורשת בקוד תכנות וברשימה של 52 שפות שכוללת גם עברית.

מתאים ל

  • חיפוש סמנטי במסמכים ארוכים

    חלון של 32,768 טוקנים קולט חוזים או דוחות שלמים בוקטור בודד, בלי לחתוך לקטעים קטנים.

  • שליפת קוד מרובת שפות

    האימון הייעודי על עשר שפות תכנות מאפשר למצוא פונקציות ושאילתות SQL לפי תיאור מילולי חופשי.

  • שרת חיפוש מקומי ודל תקציב

    תמיכה ב־OpenVINO ו־ONNX מריצה אותו בקצב גבוה על מעבד סטנדרטי בלי להחזיק כרטיס מסך יקר.

איפה זה נופל

חיתוך המודל מ־22 שכבות ל־12 וצמצום המילון ל־180 אלף טוקנים גובים מחיר בשפות עם מעט משאבים ברשת. למרות שהכרטיס מדבר על מעל 200 שפות, רק 52 מהן קיבלו אימון ייעודי לזוגות שליפה, ובשאר השפות האיכות צונחת ונשענת רק על העברה עיוורת. בנוסף, בניגוד לגרסת ה־311M, המודל הזה לא תומך בקיצוץ ממדים של וקטורים (Matryoshka), ואם אתם עובדים עם מערכת מבוססת Ollama קחו בחשבון שהיא כרגע לא תומכת בארכיטקטורת ModernBERT שבה הוא משתמש.

שאלות
נפוצות

האם המודל עובד טוב בעברית?

עברית נמצאת ברשימת 52 השפות שקיבלו אימון ייעודי עם זוגות שליפה, כך שהיא לא נשענת רק על ניחוש גנרי. עם זאת, בגלל צמצום המילון ל־180 אלף מונחים, ייצוג הטוקנים בעברית עשוי להיות ארוך יותר מאשר באנגלית. שווה לבדוק את איכות ההחזרות על הדאטה הספציפי שלכם לפני שמתחייבים.

מה ההבדל המרכזי בינו לבין גרסת ה־311M?

המודל הגדול מדויק יותר ומציע וקטורים בגודל 768 עם אפשרות חיתוך לגדלים נמוכים יותר, אך דורש פי שלושה יותר משאבים. המודל הנוכחי פולט וקטור קבוע של 384 ממדים, רץ מהר יותר ב־40 אחוזים בערך, ומיועד למערכות שצריכות זמני תגובה נמוכים מאוד.

איך מריצים

בגלל המשקל הקטן, 1.1 גיגה בייט בלבד, אפשר להריץ אותו ישירות דרך ספריית sentence-transformers על כל מעבד מודרני בלי להזיע. הוא לא דורש כרטיס גרפי ייעודי בשביל תעבורה סבירה, ומגיע מהקופסה עם קובצי ONNX ו־OpenVINO שמקצרים זמני ריצה, כולל גרסת INT8 מכוילת למעבדי אינטל. מי שמעדיף שרת ייעודי יכול להרים מופע vLLM בפקודה בודדת או להמיר לפורמט GGUF עבור llama.cpp.

אין סיבה אמיתית לשלם על API חיצוני כשמודל כזה רץ מקומית בכל מכונה בסיסית או בקונטיינר זול. פונים ל־API חיצוני או לשירות מנוהל רק אם אין לכם תשתית שרתים משלכם או שאתם לא רוצים לנהל שום תהליך ברקע.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("ibm-granite/granite-embedding-97m-multilingual-r2")
v = m.encode(["שלום עולם"])

הרישיון

המודל משוחרר תחת רישיון Apache 2.0 מלא. מותר להשתמש בו במוצרים מסחריים, לשנות את המשקלים, לארח אותו או להפיץ אותו כחלק מתוכנה קניינית, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. יבמ גם מציינת שכל המידע שעליו אומן המודל עבר סינון משפטי ונאסף תחת רישיונות מתירניים, מה שמקטין סיכוני תביעות בארגונים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗