GPT
C

chinese-roberta-wwm-ext

קוד פתוח

hflapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

מודל שפה מבוסס BERT לסינית שמיישם מיסוך מילים שלמות במקום תווים בודדים. הוא מיועד למי שצריך ייצוג מדויק יותר של סינית למשימות הבנה או חיזוי מילים.

  • 512טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 56,764הורדות בחודש
  • 425לייקים

מה זה

מדובר בארכיטקטורת BERT קלאסית בת 12 שכבות שמבצעת משימת השלמת מילים מוסתרות בטקסט סיני. ההבדל העיקרי כאן הוא השימוש בטכניקת מיסוך מילים שלמות. בסינית, מילים מורכבות לרוב מכמה תווים, וכאשר מסתירים רק תו בודד המודל יכול לנחש אותו בקלות יחסית לפי התו שלידו בלי להבין את המשמעות הרחבה. אימון על מילים שלמות מכריח את הרשת ללמוד קשרים עמוקים יותר בין חלקי המשפט.

הפרויקט נשען על מחקר שפרסמו החוקרים של HFL, ומביא את הגישה הזו למבנה המוכר של transformers. המשקל הכולל יושב על 1.1 גיגה בייט, שזה הגודל הסטנדרטי למודלי בסיס מסוג זה, והוא מתמקד בטקסטים בסינית בלבד.

מתאים ל

  • השלמת מילים בסינית

    חיזוי טוקנים חסרים במשפטים בסינית בעזרת הבנה הקשרית של מילים שלמות.

  • חילוץ וקטורים לטקסט סיני

    שימוש בשכבות המודל כבסיס לייצוג טקסט למנועי חיפוש וסיווג בסינית.

  • אימון ייעודי למשימות סיווג

    בסיס התחלתי לכוונון עדין על דאטה ייעודי של סיווג משפטים או ניתוח רגש.

איפה זה נופל

הוא מוגבל לשפה הסינית בלבד, כך שטקסט בעברית או באנגלית לא יקבל מענה אמיתי כאן. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים, מה שחוסם עיבוד ישיר של מסמכים ארוכים ללא חיתוך מוקדם. מעבר לכך, מדובר במודל מסווה ולא במודל גנרטיבי, כך שהוא לא יודע לייצר טקסט חופשי או לנהל שיחה, אלא רק להשלים טוקנים ספציפיים או לשמש בסיס למיצוי וקטורים ולסיווג.

שאלות
נפוצות

איך טוענים את המודל בקוד אם קוראים לו RoBERTa?

הכרטיס מדגיש בפירוש שצריך להשתמש בפונקציות ובמחלקות שקשורות ל־BERT. השם כולל התייחסות לטכניקת האימון, אך המבנה הטכני נשען על BertForMaskedLM.

האם אפשר להשתמש בו לייצור תשובות או לשיחה?

לא. המודל בנוי למשימת השלמת מילים מוסתרות ולא ליצירת טקסט רציף. אם המטרה היא צ'אט או כתיבה יוצרת, צריך לחפש מודלים גנרטיביים.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון, אבל למרות השם שמכיל RoBERTa, היוצרים מדגישים שחובה לטעון אותו בעזרת המחלקות של Bert, כמו BertForMaskedLM או BertTokenizer.

עם משקל של 1.1 גיגה בייט וחלון הקשר של 512 טוקנים, אין שום בעיה להריץ אותו מקומית או בייצור על גבי כרטיס מסך פשוט יחסית, ואפילו על מעבד רגיל עבור נפחי תעבורה נמוכים. אין פה שום צורך לפנות לשירותי ענן יקרים רק בשביל אינפרנס של מודל בגודל כזה, אלא אם אתם עובדים בסקייל חריג שדורש אופטימיזציות מיוחדות.

from transformers import pipeline

pipe = pipeline("fill-mask", model="hfl/chinese-roberta-wwm-ext")
print(pipe("שלום"))

הרישיון

הרישיון הוא apache-2.0. זה מאפשר להשתמש במודל לצרכים מסחריים, לשנות אותו, לאמן אותו מחדש או לשלב אותו בתוך מוצר סגור. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, בלי אחריות משפטית מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗