GPT
E

EuroBERT-2.1B

קוד פתוח

EuroBERTapache-2.02025-02-21

  • transformers
  • pytorch
  • safetensors
  • eurobert
  • fill-mask

זהו אנקודר רב לשוני גדול שתומך בטקסטים ארוכים במיוחד של עד 8,192 טוקנים. הוא פונה למי שמחפש מנוע חזק לאחזור מידע, סיווג ודירוג טקסט בשפות אירופיות וקוד.

  • 2.4Bפרמטרים
  • 8,192טוקנים בהקשר
  • 17.9 GBמשקל הקבצים
  • 2,807הורדות בחודש

מה זה

מדובר במודל אנקודר בלבד בגודל של 2.4 מיליארד פרמטרים, שנועד למשימות ייצוג טקסט ולא ליצירת שיחות. הוא תומך בעד 8,192 טוקנים, שזה חלון הקשר נדיר עבור משפחת ה־BERT, שרובה עדיין תקועה ב־512 טוקנים. המודל מתמחה ב־15 שפות, לצד הבנה חזקה של קוד ונוסחאות מתמטיות, ועוקף לפי הבדיקות של המפתחים מערכות גדולות וותיקות כמו XLM-RoBERTa-XL.

המטרה העיקרית שלו היא לשמש בסיס לאימון ייעודי עבור חיפוש סמנטי, סיווג רגשות ומדידת איכות של תרגומים. בניגוד למודלים גנרטיביים מנופחים, אנקודר בגודל כזה מייצר וקטורים מדויקים יותר למסמכים שלמים בלי צורך לחתוך אותם לפסקאות קצרות. בכרטיס המודל מדווח שהוא מנצח במבחני אחזור וסיווג רב-לשוניים, כולל משימות מורכבות של זיהוי כוונות וניתוח סיבוכיות קוד.

מתאים ל

  • אחזור מסמכים רב לשוני

    חלון של 8,192 טוקנים מאפשר לקרוא חוזים ומאמרים שלמים בשפות אירופיות בלי לחתוך אותם למקטעים.

  • חיפוש בקוד ובמתמטיקה

    המודל אומן על קוד ונוסחאות, ומתאים לבניית מנועי חיפוש פנימיים למאגרי תוכנה ומסמכים הנדסיים.

  • סיווג טקסטים ארוכים

    הוא מציג ביצועים גבוהים במיון כוונות, בדיקת איכות תרגום וסיווג נושאים במסמכים מורכבים.

איפה זה נופל

המודל מיועד למשימות מילוי מסכות ואחזור, והוא אינו מודל שיחה שיודע לענות לשאלות או לכתוב טקסט חופשי. מבחינת שפות, המיקוד הוא אירופי בתוספת סינית, כך שעברית כלל אינה נתמכת ברשימה הרשמית והוא צפוי להיכשל בניתוח טקסט עברי. בנוסף, מודל אנקודר בגודל 2.4 מיליארד פרמטרים הוא כבד ואיטי משמעותית מ־BERT רגיל, מה שהופך אותו לבעייתי בסביבות זמן אמת שדורשות השהיה אפסית.

אותה משפחה

EuroBERT יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל עובד טוב בעברית?

לא. רשימת השפות הרשמית כוללת אנגלית, צרפתית, גרמנית, ספרדית, סינית, איטלקית, רוסית ופולנית בלבד, ולכן הוא לא יתאים למשימות בעברית.

האם אפשר להשתמש בו כמו צ'אטבוט?

לא, זהו מודל מסוג אנקודר שמנחש מילים מוסתרות ומייצר וקטורים. הוא לא יודע לייצר תשובות ארוכות או לנהל שיחה עם משתמשים.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־17.9 גיגה-בייט בגלל ייצוג float32, כך שבשביל לטעון אותו בצורה גולמית תצטרכו כרטיס מסך עם לפחות 24 גיגה-בייט זיכרון, כמו RTX 3090 או A10. המפתחים ממליצים להתקין את תוסף Flash Attention 2 כדי לייעל את צריכת הזיכרון והמהירות בריצות ארוכות.

ההרצה מתבצעת דרך ספריית transformers החל מגרסה 4.48.0 עם הדגל trust_remote_code. מי שרוצה רק תיוג מהיר לטקסטים קצרים בלי להחזיק שרת כבד, עדיף שישתמש בגרסאות הקטנות יותר של 210 מיליון או 610 מיליון פרמטרים מאותה סדרה.

from transformers import pipeline

pipe = pipeline("fill-mask", model="EuroBERT/EuroBERT-2.1B")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי לחלוטין. אפשר לשנות את המשקלים, לאמן אותם על דאטה פנימי ולשלב את המערכת במוצרים מסחריים סגורים בלי לחשוף את הקוד שלכם, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗