GPT
M

mmBERT-base

קוד פתוח

jhu-clspmit2025-07-23

  • transformers
  • pytorch
  • modernbert
  • fill-mask
  • aai

אנקודר מודרני שתומך ביותר מ־1,800 שפות עם חלון הקשר של 8,192 טוקנים. תחליף עדכני, מהיר ומשמעותי למודלים מיושנים כמו XLM-R במשימות סיווג ושליפה.

  • 8,192טוקנים בהקשר
  • 1.2 GBמשקל הקבצים
  • 368,182הורדות בחודש
  • 243לייקים

מה זה

זהו אנקודר דו-כיווני המבוסס על ארכיטקטורת ModernBERT, שאומן על יותר מ־3 טריליון טוקנים. הוא נועד למשימות של ייצוג טקסט, אחזור מידע וסיווג בשפות רבות, כולל שפות דלות משאבים. בניגוד לאנקודרים ותיקים שנתקעו על הקשר קצר, כאן מקבלים תמיכה מובנית בטקסטים ארוכים במיוחד יחד עם שיפורי מהירות כמו Flash Attention 2.

החידוש העיקרי כאן הוא תהליך האימון. הצוות התחיל מ־60 שפות נפוצות, הרחיב ל־110, ורק בשלב הדעיכה הסופי שילב 1,833 שפות תוך שימוש בדגימת טמפרטורה הפוכה ומיזוג מודלים. לפי מפתחי המודל, הגישה הזו מובילה לביצועים שעוקפים בבירור את XLM-R במשימות סיווג ושליפה, בלי לוותר על מהירות ריצה גבוהה בהרבה.

מתאים ל

  • אחזור מידע רב-לשוני

    מתאים לבניית מנועי חיפוש סמנטיים במסמכים ארוכים בזכות חלון הקשר של 8,192 טוקנים ותמיכה במאות שפות.

  • סיווג מסמכים וטקסטים

    בסיס מצוין לכוונון עדין של מודלי סיווג רב-לשוניים, תוך ניצול ארכיטקטורה מהירה ומודרנית.

  • העברת ידע בין שפות

    מאפשר לאמן משימה על שפה עתירת משאבים ולהחיל אותה ישירות על שפות נדירות יותר.

איפה זה נופל

זהו מודל מסוג אנקודר בלבד, לא מודל יוצר. הוא לא כותב תשובות, לא מנהל שיחות ולא מסכם טקסטים בצורה חופשית. המשימה המקורית שלו היא fill-mask, כך שכדי להשתמש בו לחיפוש סמנטי או לסיווג מסמכים תצטרכו לבצע כוונון עדין או להשתמש בו דרך ספריות ייעודיות כמו Sentence Transformers.

בנוסף, למרות התמיכה ביותר מ־1,800 שפות, רוב השפות דלות המשאבים נכנסו רק ב־100 מיליארד הטוקנים האחרונים של האימון. חובה לבדוק את איכות הייצוגים בפועל בשפה הספציפית שלכם לפני שמסתמכים עליו במוצר.

שאלות
נפוצות

האם המודל מתאים ליצירת טקסט כמו צ'אטבוט?

לא. מדובר באנקודר שמטרתו להבין טקסט ולייצר וקטורים מייצגים, בדומה ל־BERT. הוא אינו מודל ג'נרטיבי ולא מסוגל לייצר תשובות או תוכן חדש.

למה רוב הפרמטרים מוקדשים לאוצר המילים?

הטוקנייזר מכיל 256,000 מונחים כדי לתמוך ביותר מ־1,800 שפות. מתוך 307 מיליון פרמטרים, רק 110 מיליון נמצאים בשכבות החישוב של המודל, מה שהופך את פעולת החישוב עצמה לקלה ומהירה במיוחד.

איך מריצים

כדי להריץ אותו צריך רק פייתון, PyTorch בגרסה 1.9 ומעלה וספריית transformers החל מגרסה 4.21.0. המודל שוקל 1.2 גיגה-בייט בלבד, עם 307 מיליון פרמטרים שרובם בכלל שכבת הוטמעות ענקית של הטוקנייזר של Gemma 2. זה אומר שכל כרטיס מסך בסיסי או אפילו מעבד מודרני מריצים אותו בלי בעיה.

אם הזיכרון מוגבל מאוד, יש במשפחה גם גרסת small עם 140 מיליון פרמטרים. אין שום סיבה לשלם על API חיצוני בשביל מודל בגודל כזה, אתם מריצים אותו מקומית או בתוך השרת שלכם בקלות ובזול.

from transformers import pipeline

pipe = pipeline("fill-mask", model="jhu-clsp/mmBERT-base")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 1.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקולות מפורסמים תחת רישיון MIT. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים וכתב הוויתור המקוריים של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗