GPT
E

EuroBERT-210m

קוד פתוח

EuroBERTapache-2.02025-02-21

  • transformers
  • pytorch
  • safetensors
  • eurobert
  • fill-mask

זהו מודל אנקודר רב-לשוני קטן שמתאים לשליפה וסיווג טקסטים ארוכים. הוא תומך בהקשר של עד 8,192 טוקנים, חריג מאוד בגדלים האלה, ומיועד למי שצריך ביצועים מקומיים מהירים.

  • 310Mפרמטרים
  • 8,192טוקנים בהקשר
  • 2.3 GBמשקל הקבצים
  • 31,479הורדות בחודש

מה זה

מדובר באנקודר של כ־310 מיליון פרמטרים מתוך סדרה חדשה של שלושה גדלים, שנועד למשימות כמו אחזור מידע, סיווג, מתמטיקה וקוד. הנקודה הבולטת בו היא חלון ההקשר שלו, שמגיע ל־8,192 טוקנים, לעומת מגבלת 512 הטוקנים המוכרת ממודלי BERT ישנים יותר. המפתחים מציגים אותו כחלופה מודרנית וקלה למודלים רב-לשוניים ותיקים.

לפי כרטיס המודל, הוא עוקף מערכות מקבילות בגודל שלו במגוון מבחנים, כולל מדדי סיווג כמו XNLI ומדדי אחזור כמו MIRACL ו־MLDR. המשמעות בפועל היא שאפשר לקבל איכות סבירה למשימות חיפוש סמנטי או ניתוח רגש בלי לשלם במשקלי ענק, אם כי המבחנים המוצגים כלליים ואינם מפרטים ציונים מספריים מדויקים מול מתחרים ספציפיים.

מתאים ל

  • שליפת מסמכים ארוכים

    חלון של 8,192 טוקנים מאפשר לבצע חיפוש סמנטי על מסמכים מלאים בשפות נתמכות בלי לחתוך אותם לפסקאות קצרות.

  • סיווג קוד ופגמים

    הוא אומן על קוד ומציג התאמה למשימות כמו הערכת מורכבות או איתור באגים בתוך מאגרי תוכנה.

  • סיווג כוונות רב-לשוני

    הגודל הקל מאפשר זמן תגובה מהיר בסיווג פניות תמיכה בשפות אירופיות על חומרה צנועה.

איפה זה נופל

החיסרון המרכזי לקורא הישראלי הוא השפות. המודל נבנה לשפות אירופיות ומציין תמיכה בשפות כמו אנגלית, צרפתית, גרמנית, ספרדית, פולנית ורוסית, ללא עברית ברשימה הנתמכת, מה שהופך אותו ללא מתאים לטקסט מקומי בלי אימון מחדש. בנוסף, הוא מודל Masked LM ולא מודל גנרטיבי, כך שהוא לא יודע לייצר טקסט חופשי, לנהל שיחה או לסכם מסמכים בעצמו. כדי להפיק ממנו ערך אמיתי תצטרכו להשקיע בכוונון עדין למשימה הספציפית שלכם.

אותה משפחה

EuroBERT יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לטקסטים בעברית?

לא כדאי. המודל מוגדר לשפות אירופיות מסוימות ועברית לא נכללת ברשימת השפות הנתמכות שלו, כך שהטוקנייזר והייצוגים שלו לא יתאימו לטקסט עברי ללא אימון ייעודי.

האם המודל יכול לשמש כצ'אטבוט?

לא. זהו אנקודר מסוג Masked LM שמיועד לחזות מילים חסרות, להפיק וקטורים או לשמש בסיס לסיווג, ולא מודל שמייצר תשובות או מנהל שיחה.

איך מריצים

המודל שוקל 2.3 גיגה-בייט ומגיע בדיוק של float32, כך שכל כרטיס מסך בסיסי או אפילו מעבד מודרני יריצו אותו בלי בעיה. כדי להפעיל אותו נדרשת ספריית transformers מגרסה 4.48.0 ומעלה עם trust_remote_code=True, וכדאי להתקין Flash Attention 2 לשיפור המהירות בהקשרים ארוכים.

הוא זמין לצד שני אחים גדולים יותר, 610M ו־2.1B, שמציגים דיוק גבוה יותר במחיר של דרישות זיכרון כבדות. אם אתם צריכים רק להטמיע טקסטים פשוטים או לסווג פניות בזמן אמת, הרצה עצמית שלו תהיה זולה ופשוטה בהרבה מתלות ב־API חיצוני.

from transformers import pipeline

pipe = pipeline("fill-mask", model="EuroBERT/EuroBERT-210m")
print(pipe("שלום"))

הרישיון

המודל, המשקלים וקוד האימון משוחררים תחת רישיון Apache 2.0. הרישיון מאפשר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או במוצר סגור, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗