GPT
W

wangchanberta-base-att-spm-uncased

קוד פתוח

airesearchרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • safetensors
  • camembert
  • fill-mask

מודל RoBERTa ייעודי לשפה התאילנדית, מאומן מראש על 78.5 גיגה-בייט של טקסט מקומי. הוא מתאים למי שצריך מודל בסיס קל לעיבוד תאילנדית, במקום להסתמך על מודלים רב-לשוניים כלליים.

  • 106Mפרמטרים
  • 512טוקנים בהקשר
  • 809 MBמשקל הקבצים
  • 154,310הורדות בחודש

מה זה

זהו מודל שפה בארכיטקטורת RoBERTa עם 12 שכבות וכ־106 מיליון פרמטרים, המיועד למשימות השלמת מילים חסרות (fill-mask). הוא אומן על קורפוס של 381,034,638 משפטים ייחודיים בתאילנדית, הכוללים מעל 16 מיליארד מילים ומעל 8 מיליארד תת-מילים.

הייחוד שלו מול מודלים גנריים בגודל הזה טמון בטוקניזציה ובעיבוד המקדים. מכיוון שבתאילנדית אין רווחים בין מילים כמו באנגלית, החוקרים שילבו מילון maximal matching ייעודי יחד עם מודל SentencePiece עם אוצר מילים של 25,000 תת-מילים. בנוסף, רווחים סומנו במפורש באמצעות תו מיוחד כדי לשמר את גבולות המשפט, מה שמספק בסיס חזק למשימות המשך כמו סיווג טקסט ותיוג ישויות.

מתאים ל

  • סיווג רגשות בפוסטים

    זיהוי סנטימנט חיובי, ניטרלי, שלילי או שאלה ברשתות חברתיות, לאחר אימון המשך על דאטה ייעודי בתאילנדית.

  • תיוג ישויות בתאילנדית

    זיהוי שמות וחלקי דיבר בטקסט מקומי, בזכות טוקניזציה מדויקת ששומרת על מבנה המשפט התאילנדי.

  • סיווג כתבות ונושאים

    שיוך טקסטים מקומיים לקטגוריות תוכן שונות, תוך שימוש בידע המוקדם שנלמד מקורפוס החדשות Prachathai.

איפה זה נופל

האימון של המודל לא הסתיים בפועל. היוצרים עצמם מציינים שהם שחררו את הצ'קפוינט בשלב 360,000 במקום ב־500,000, מה שאומר שהמודל יצא לפני שהגיע להתכנסות מלאה. בנוסף, המודל אומן רק על תאילנדית עם חלון הקשר של 512 טוקנים (ומוגבל בפועל ל־416 טוקנים באימון), כך שהוא לא מתאים לעברית, לאנגלית או לעיבוד מסמכים ארוכים. הוא גם לא מייצר טקסט חופשי אלא משמש כבסיס להתאמה אישית או להשלמת טוקנים בלבד.

שאלות
נפוצות

האם המודל תומך בעברית או באנגלית?

לא. המודל אומן על קורפוס תאילנדי בלבד עם טוקנייזר ייעודי של 25,000 תת-מילים בתאילנדית. אם תזינו לו עברית, הוא פשוט לא יידע איך לפרק את הטקסט או להבין אותו.

האם אפשר להשתמש בו ישירות לצ'אטבוט או ליצירת טקסט?

לא. זוהי ארכיטקטורת RobertaForMaskedLM המיועדת להשלמת מילים חסרות בתוך טקסט. בשביל צ'אט או ייצור טקסט צריך מודלים גנרטיביים, או שצריך להוסיף מעל המודל הזה שכבת סיווג ולאמן אותה למשימה ספציפית.

מה החומרה המינימלית הנדרשת כדי להריץ אותו בפרודקשן?

במשקל כולל של כ־809 מגה-בייט ו־106 מיליון פרמטרים, המודל ירוץ ללא קושי על מעבד שרת רגיל בלי GPU ייעודי. אם נדרש עיבוד של עשרות בקשות בשנייה, מאיץ גרפי פשוט וזול עם 4 גיגה-בייט זיכרון יספק זמני תגובה מהירים.

איך מריצים

המודל שוקל 809 מגה-בייט ב־8 קבצים ורץ דרך ספריית transformers הרגילה של פייתון. הוא קל מאוד, כך שלא צריך שרת מפלצתי. כל מעבד מודרני ממוצע מריץ אותו בקלות, וכרטיס מסך בסיסי עם 2 עד 4 גיגה זיכרון יספיק כדי לקבל זמני תגובה של מילישניות בודדות.

האימון המקורי התבצע על 8 מעבדי V100 באורך רצף של עד 416 טוקנים, אך הוא שוחרר מוקדם בצ'קפוינט של 360,000 צעדים מתוך חצי מיליון מתוכננים. בגלל המשקל הנמוך, אין סיבה אמיתית לשלם על API חיצוני אם אתם כבר מחזיקים שרת אפליקציה קיים.

from transformers import pipeline

pipe = pipeline("fill-mask", model="airesearch/wangchanberta-base-att-spm-uncased")
print(pipe("שלום"))

הרישיון

היוצרים לא דיווחו על רישיון שימוש במאגר. מבחינה משפטית, היעדר רישיון אומר שכל הזכויות שמורות להם, ואין הרשאה מפורשת להשתמש במודל, לשנות אותו או להפיץ אותו במוצר מסחרי. מי שרוצה להכניס אותו למערכת עסקית לוקח סיכון וצריך לבדוק קודם את תנאי המאגר המקורי ב־GitHub.

הרישיון המלא בעמוד המודל ↗