GPT
G

granite-embedding-small-english-r2

קוד פתוח

ibm-graniteapache-2.02025-07-17

  • sentence-transformers
  • pytorch
  • safetensors
  • modernbert
  • feature-extraction

זהו מודל שיכוך טקסט קומפקטי שמביא חלון הקשר נדיר של 8,192 טוקנים לגודל של 48M פרמטרים. הוא מיועד למי שצריך מנוע חיפוש פנימי מהיר וזול על מסמכים ארוכים באנגלית בלי כאבי ראש של זכויות יוצרים.

  • 48Mפרמטרים
  • 8,192טוקנים בהקשר
  • 185 MBמשקל הקבצים
  • 6,296,680הורדות בחודש

מה זה

מדובר במודל bi-encoder קטן במיוחד שמייצר וקטורים בגודל 384 ממדים ומבוסס על ארכיטקטורת ModernBERT. המטרה המרכזית שלו היא אחזור מידע עבור מנועי חיפוש ומערכות RAG. למרות הגודל המזערי, הוא מקבל טקסטים ארוכים פי שישה עשר מרוב המודלים המקבילים בקטגוריה, שעוצרים בדרך כלל ב־512 טוקנים.

במבחני ביצועים מול מודלים פופולריים במשקל דומה כמו bge-small-en-v1.5 ו־e5-small-v2, הוא עוקף אותם בפער ניכר עם ציון ממוצע של 55.6 מול סביבות ה־45 שלהם. הפער מורגש במיוחד במבחני MLDR ו־LongEmbed שבודקים מסמכים ארוכים, שם חלון ההקשר הגדול שלו נותן עבודה אמיתית ולא רק מספר יפה על הנייר. בנוסף, הוא מגיע לקצב עיבוד של 199 מסמכים בשנייה על מעבד H100 יחיד, מה שמציב אותו בראש הטבלה מבחינת מהירות מול איכות בקטגוריית המשקל שלו.

מתאים ל

  • חיפוש בקוד ומסמכים טכניים

    אימון המודל כלל נתונים טכניים וקוד, והוא משיג תוצאה של 53.8 במבחן CoIR לחיפוש קוד.

  • שליפת מידע ממסמכים ארוכים

    חלון של 8,192 טוקנים מאפשר להמיר דוחות ומאמרים מלאים לווקטור יחיד בלי לחתוך אותם למקטעים קטנים.

  • אחזור מידע מטבלאות

    הוא נבדק על חמישה מבחני טבלאות שונים וקיבל ציון של 75.51, שמתאים לחיפוש מדויק בתוך נתונים מובנים.

איפה זה נופל

הוא מוגבל לאנגלית בלבד. אם תזינו לו טקסטים בעברית, התוצאות יהיו חסרות ערך והוא לא מיועד לשימוש רב־לשוני. מעבר לזה, כדי לשמור על רישיון מסחרי נקי, IBM ויתרו לחלוטין על סט הנתונים הפופולרי MS-MARCO שרוב מודלי הקוד הפתוח מתאמנים עליו. במבחני שיחות מרובות שלבים כמו MTRAG הוא מציג ציון של 48.1, שזה נמוך משמעותית מגרסת ה־149M שמגיעה ל־57.6. אם המטרה שלכם היא חיפוש בהיסטוריית צ'אט מורכבת, הגודל המזערי שלו כבר מציג פשרות מורגשות.

שאלות
נפוצות

האם המודל מתאים ליישומים בעברית?

לא. המודל אומן אך ורק על טקסטים באנגלית, והטוקנייזר שלו לא נבנה עבור עברית. שימוש בו לשפה המקומית יפיק וקטורים באיכות ירודה ולא שמישה.

האם חובה להתקין כרטיס מסך כדי להריץ אותו בייצור?

ממש לא. בנפח של 185 מגה־בייט ו־48 מיליון פרמטרים, המודל רץ מהר מאוד גם על מעבדי שרת רגילים ללא תלות בחומרה גרפית ייעודית.

איך מריצים

במשקל קבצים כולל של 185 מגה־בייט ובדיוק bfloat16, המודל הזה עולה ורץ כמעט על כל דבר. אפשר לדחוף אותו למעבד רגיל של שרת זול, למחשב נייד ישן או למעבד גרפי קטן בקצה בלי להרגיש אותו כמעט בזיכרון ה־RAM. ההרצה נעשית ישירות דרך ספריית sentence-transformers או דרך transformers הרגילה של Hugging Face, ומי שמריץ על חומרה תומכת יכול להתקין Flash Attention 2 כדי לסחוט עוד מהירות.

גרסת ה־R2 מגיעה גם במשקל 149M פרמטרים שמוציאה וקטורים של 768 ממדים ומציגה דיוק מעט גבוה יותר. אם התשתית שלכם קטנה, פער הביצועים לטובת הגרסה הגדולה לא מצדיק את התוספת בנפח האחסון ובגודל הווקטורים במסד. אין שום סיבה אמיתית לשלם ל־API חיצוני על משימות שיכוך כשיש מודל ששוקל פחות מתמונה ברזולוציה גבוהה ורץ לוקאלית במהירות כזו.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("ibm-granite/granite-embedding-small-english-r2")
v = m.encode(["שלום עולם"])

הרישיון

הוא מופץ תחת רישיון apache-2.0 חופשי לחלוטין. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו ללא תשלום תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי. IBM גם הקפידה לסנן את נתוני האימון כדי לוודא שאין בהם הפרות זכויות יוצרים, מה שמקטין סיכונים משפטיים לחברות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗