GPT
M

muril-base-cased

קוד פתוח

googleapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

גרסת BERT של גוגל שאומנה על 17 שפות הודיות ואנגלית. היא מיועדת למי שצריך לעבד טקסטים מהודו, במיוחד כאלה שנכתבו באותיות לטיניות.

  • 512טוקנים בהקשר
  • 3.2 GBמשקל הקבצים
  • 70,972הורדות בחודש
  • 63לייקים

מה זה

הארכיטקטורה כאן היא BertForMaskedLM סטנדרטית עם 12 שכבות, שגוגל אימנו מאפס על ויקיפדיה, Common Crawl ומאגרים מקומיים כמו PMINDIA ו־Dakshina. ההבדל המרכזי מול מודלים רב־לשוניים כלליים נמצא בנתוני האימון. גוגל הכניסו פנימה זוגות מתורגמים וזוגות של תעתיק פונטי באותיות לטיניות, והעלו את משקל השפות הדלות במשאבים באמצעות מקדם של 0.3.

במדדי XTREME ההתמקדות הזו ניכרת מיד. במשימות זיהוי ישויות בטקסט מתועתק, המודל מגיע לממוצע ציון F1 של 57.70 מול 14.24 בלבד של mBERT. בטקסטים רגילים בהינדית או בנגאלית הוא מוביל בעקביות, אך במשימת Tatoeba לשליפת משפטים הוא משיג רק 25.15 אחוזי דיוק, מה שאומר שהוא מתאים לסיווג והבנה ולא לשליפה דקדקנית.

מתאים ל

  • סיווג טקסט בהינדי מתועתק

    המודל אומן על תעתיק לטיני ומגיע ל־64.7 אחוזי דיוק ב־XNLI מתועתק לעומת 39.23 של mBERT.

  • זיהוי ישויות בשפות הודו

    אימון המודל על 17 שפות מקומיות מביא אותו לציון F1 של 77.6 במשימת PANX ברחבי השפות הללו.

  • מענה לשאלות באורדו ובנגאלית

    במדד TyDiQA הוא מגיע לציון F1 של 75.36 בממוצע, בזכות ייצוגים מאוזנים יותר לשפות מקומיות.

איפה זה נופל

גוגל מבהירים שהמודל לא נבנה לעבוד מחוץ ל־17 השפות שהוגדרו מראש. אין כאן תמיכה בעברית או בשפות אירופאיות אחרות מלבד אנגלית. חלון ההקשר מוגבל ל־512 טוקנים, כך שטקסטים ארוכים ייחתכו. בנוסף, אף על פי שהוא מתעלה על mBERT בטקסט מתועתק, הדיוק במשימות מסוימות כמו Tatoeba על תעתיק עומד על כ־10 אחוזים בלבד.

שאלות
נפוצות

האם המודל מתאים לטקסטים בעברית?

לא. המודל אומן על 17 שפות הודיות ואנגלית בלבד. הכרטיס מציין במפורש שהוא אינו צפוי לפעול היטב על שפות אחרות.

האם המודל מסוגל לייצר טקסט חופשי כמו צ'אט?

לא, זו ארכיטקטורת BertForMaskedLM שמיועדת למילוי מילים חסרות, סיווג, וחילוץ מידע. הוא אינו מודל שפה גנרטיבי.

איך מריצים

אתם טוענים אותו ישירות דרך ספריית transformers בפייתון עם משקל כולל של 3.2 גיגה־בייט. בשביל להריץ אותו להסקה לא צריך מפלצת חומרה, כרטיס מסך בסיסי או מעבד מודרני בשרת ענן יספיקו בהחלט, שכן מדובר בגודל סטנדרטי לחלוטין של מודל בסיס.

המפתחים ממליצים לבצע פיין־טיונינג לכל הפרמטרים במודל עבור המשימה שלכם ולא להסתפק בהקפאת שכבות. אם המטרה היא רק ניתוח טקסט חד־פעמי או סיווג פשוט, אפשר להשתמש באנקודר של TFHub שכולל מודול עיבוד מקדים מוכן לקלט.

from transformers import pipeline

pipe = pipeline("fill-mask", model="google/muril-base-cased")
print(pipe("שלום"))

הקבצים

9 קבצים במאגר, 3.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא apache-2.0, רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי הקוד והפצה של המודל בחינם. התנאי המרכזי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי בקבצים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗