GPT
G

granite-embedding-311m-multilingual-r2

קוד פתוח

ibm-graniteapache-2.02026-04-20

  • sentence-transformers
  • onnx
  • safetensors
  • openvino
  • modernbert

זה מודל וקטורי רב לשוני מבוסס ModernBERT עם חלון של 32,768 טוקנים. הוא פותר את הצורך באינדוקס מסמכים ארוכים וקוד בלי לחתוך אותם לחתיכות קטנות.

  • 312Mפרמטרים
  • 32,768טוקנים בהקשר
  • 3.8 GBמשקל הקבצים
  • 109,829הורדות בחודש

מה זה

IBM החליפה את הארכיטקטורה הישנה של XLM-RoBERTa ב־ModernBERT, וזה השינוי המרכזי כאן. במקום חלון קצרצר של 512 טוקנים, המודל הזה תומך ב־32,768 טוקנים, מה שמאפשר להזין אליו מאמרים שלמים, תיקיות קוד או שיחות ארוכות ישירות למנוע חיפוש סמנטי.

במבחן Multilingual MTEB Retrieval המודל קיבל ציון של 65.2, שזה שיפור של 13 נקודות מהגרסה הקודמת של 278 מיליון פרמטרים. במבחן LongEmbed למסמכים ארוכים הוא מגיע ל־71.7, קפיצה כפולה כמעט מהדור הקודם, מה שמראה שהארכיטקטורה החדשה באמת מנצלת את ההקשר הרחב ולא סתם מדביקה מספר גדול במפרט.

הוא כולל גם מנגנון Matryoshka, כך שאפשר לחתוך את הווקטור מ־768 ממדים ל־256 או אפילו 128 בלי לאבד הרבה דיוק. לפי המדידות, ירידה ל־256 מורידה את הציון ב־MTEB האנגלי מ־52.6 ל־51.6 בלבד, וזה חוסך המון מקום בבסיס הנתונים הווקטורי.

מתאים ל

  • חיפוש סמנטי בקוד מקור

    הוא אומן על פייתון, ג'אווה, SQL ועוד, ויודע לקשר בין שאלות בשפה טבעית לקטעי קוד ארוכים.

  • שליפת מסמכים משפטיים וטכניים

    חלון של 32,768 טוקנים מאפשר לאנדקס חוזים ומסמכים שלמים בלי לפרק אותם לפסקאות מבודדות.

  • חיפוש רב לשוני היברידי

    התאמה טובה לשילוב עברית ואנגלית במאגר אחד, בזכות שיפור ייעודי ברשימת 52 השפות הנתמכות.

איפה זה נופל

למרות שהוא תומך עקרונית ביותר מ־200 שפות, רק 52 שפות קיבלו אימון מפורש על זוגות חיפוש, כולל עברית, ערבית ושפות מרכזיות אחרות. שאר השפות נשענות רק על ההכשרה המוקדמת של המודל, ושם איכות השליפה יורדת בצורה מורגשת.

הטוקנייזר שלו מבוסס על Gemma 3 של גוגל, מה שמחייב קבלת תנאי השימוש של Gemma בנוסף לרישיון של המודל עצמו. מעבר לזה, חלק מנתוני האימון היו סינתטיים ונוצרו על ידי IBM, מה שעלול להכניס הטיות ניסוח מלאכותיות. צריך לבדוק אותו על שאילתות ישראליות אמיתיות לפני שמסתמכים עליו במוצר.

שאלות
נפוצות

האם כדאי להשתמש בו עבור מאגר שהוא רק באנגלית?

עדיף שלא. IBM עצמה ממליצה בדוקומנטציה להשתמש בגרסאות הייעודיות לאנגלית כמו granite-embedding-english-r2 אם המידע לא כולל שפות אחרות, כי הן מציגות ביצועים עדיפים למקרי שימוש מונו-לשוניים באותו גודל.

האם אפשר להריץ אותו על מחשב מקומי דרך Ollama?

כרגע לא. Ollama עדיין אינה תומכת במודלים שמבוססים על ModernBERT. אפשר להמיר אותו ידנית ל־GGUF ולהריץ ישירות ב־llama.cpp, או להשתמש ב־ONNX דרך Sentence Transformers.

איך מריצים

המודל שוקל 3.8 גיגה בייט ומכיל 311 מיליון פרמטרים, כך שהוא רץ בקלות על כרטיס מסך בסיסי או אפילו על מעבד סביר. IBM פרסמה אותו ישירות עם גרסאות ONNX ו־OpenVINO, כולל גרסת INT8 מכוילת שמתאימה לשרתי אינטל בלי GPU. אפשר גם לטעון אותו דרך vLLM או להמיר ל־GGUF דרך llama.cpp, אם כי Ollama עדיין לא תומכת בארכיטקטורה הזו.

כרטיס H100 בודד מספק קצב של 1,828 מסמכים בשנייה עבור קטעים של 512 טוקנים. אם יש לכם שרת מקומי צנוע והעומס נמוך, הרצה עצמית של מודל בגודל 311M היא זולה ופשוטה מאוד. אם אתם צריכים לאנדקס מאות אלפי מסמכי ענק של 32k טוקנים בבת אחת ואין לכם שרת מתאים עם Flash Attention 2, שירות מנוהל חיצוני יהיה פחות כאב ראש.

from sentence_transformers import SentenceTransformer

m = SentenceTransformer("ibm-granite/granite-embedding-311m-multilingual-r2")
v = m.encode(["שלום עולם"])

הרישיון

המודל משוחרר ברישיון Apache 2.0 שמתיר שימוש מסחרי מלא, שינוי קוד והפצה חופשית בלי תמלוגים, בתנאי ששומרים על הצהרת זכויות היוצרים והרישיון המקורי. עם זאת, הטוקנייזר נגזר מ־Gemma 3 של גוגל וכפוף לתנאי השימוש הספציפיים של Gemma, נקודה משפטית שצוותי מוצר צריכים לקחת בחשבון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗