GPT
P

phobert-base

קוד פתוח

vinaimit2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • roberta

מודל RoBERTa ייעודי לוייטנאמית שמיועד למשימות הבנת שפה ועיבוד טקסט חד־לשוני. הוא נותן בסיס מדויק יותר ממודלים רב־לשוניים כלליים למי שבונה פתרונות בשפה הזו.

  • 258טוקנים בהקשר
  • 1.7 GBמשקל הקבצים
  • 117,479הורדות בחודש
  • 71לייקים

מה זה

מדובר במודל שפה מונו־לינגואלי לוייטנאמית שמבוסס על ארכיטקטורת RoBERTa עם 12 שכבות, ומאומן למשימת fill-mask דרך ספריית transformers. בזמן שחרורו הוא הציג שיפור על פני חלופות רב־לשוניות בארבע משימות מרכזיות של עיבוד שפה טבעית: תיוג חלקי דיבר, ניתוח תחבירי, זיהוי ישויות שמיות והסקה לשונית בוייטנאמית.

המשמעות עבור מי שעובד עם וייטנאמית היא דיוק גבוה בהרבה בהשוואה למודל רב־לשוני שנחשף לשפה הזו רק בחלק קטן מאימונו. עם זאת, היוצרים עצמם מציינים מודל חדש יותר בשם BamiBERT, שפותר מגבלות קיימות בביצועים ובגמישות הקלט, כך שכדאי לשקול אותו לפני שמתחייבים לגרסה הזו.

מתאים ל

  • זיהוי ישויות בוייטנאמית

    חילוץ שמות ומונחים מטקסטים קצרים בוייטנאמית, משימה שבה המודל הציג ביצועים מובילים על פני חלופות.

  • סיווג טקסט והסקה לשונית

    אימון נוסף למשימות NLI וסיווג כוונות בתוך משפטים בודדים שאינם חורגים ממגבלת 258 הטוקנים.

  • ניתוח תחבירי ותיוג שפה

    תיוג חלקי דיבר וניתוח תלויות דקדוקי ייעודי לשפה הוייטנאמית במערכות בלשניות מובנות.

איפה זה נופל

חלון ההקשר קצר ועומד על 258 טוקנים בלבד, מה שחוסם עיבוד של פסקאות ארוכות ומסמכים שלמים בלי חיתוך אגרסיבי. בנוסף, הכרטיס מציין שהמודל דורש שלב חיצוני של חלוקה למילים (word segmentation) לפני הזנת הטקסט, ולא יודע לקבל קלט גולמי ישירות כמו מודלים מודרניים יותר.

שאלות
נפוצות

האם המודל מתאים לעיבוד טקסטים בעברית או באנגלית?

לא. המודל אומן באופן בלעדי על השפה הוייטנאמית ואינו מכיל תמיכה בשפות אחרות.

האם אפשר להזין למודל טקסט וייטנאמי חופשי כמו שהוא?

לא מומלץ. לפי כרטיס המודל נדרש עיבוד מקדים חיצוני של חלוקת מילים (word segmentation) לפני ההזנה, מגבלה שתוקנה רק במודל הממשיך BamiBERT.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.7 ג'יגה־בייט, גודל סטנדרטי למודל base שאפשר להריץ בלי בעיה על מעבד מקומי רגיל או על כרטיס מסך פשוט וזול. הסביבה נשענת ישירות על Hugging Face Transformers, כך שהטעינה וההרצה בקוד פייתון ישירות ומהירות.

קיימת גם גרסת large כבדה יותר מאותה סדרה, אבל גרסת ה־base הזו מספיקה לרוב עומסי העבודה השגרתיים. אין צורך לחפש שירותי ענן יקרים או לקרוא ל־API חיצוני, כי המודל קל מספיק לתחזוקה עצמאית בכל שרת בסיסי.

from transformers import pipeline

pipe = pipeline("fill-mask", model="vinai/phobert-base")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון MIT, שמאפשר שימוש מסחרי, שינוי והפצה כמעט ללא הגבלות. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים, והיוצרים מבקשים לצטט את המאמר שלהם מ־EMNLP 2020 אם אתם משלבים את המודל בתוכנה או בפרסום.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗