GPT
C

chinese-bert-wwm

קוד פתוח

hflapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

מודל שפה לסינית שמיישם מיסוך מילים שלמות במקום תווים בודדים. הוא מיועד למי שצריך משימות מילוי מסכות או בסיס לאימון מורכב בסינית.

  • 512טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 323,463הורדות בחודש
  • 96לייקים

מה זה

מדובר בגרסת BERT לסינית שמבוססת על הארכיטקטורה המקורית של גוגל, עם 12 שכבות וחלון הקשר של 512 טוקנים. ההבדל המרכזי כאן מול גרסאות בסיסיות רגילות נובע משיטת האימון. במקום להסתיר תווים סיניים בודדים באופן אקראי, הוא אומן עם Whole Word Masking שמסתיר מילים שלמות. זה מאלץ את הרשת ללמוד את ההקשר של הביטוי המלא ולא רק לנחש תו בודד מתוך מילה.

המודל מבצע משימת fill-mask באופן ישיר דרך ספריית transformers, אבל בפועל משתמשים בו לרוב כנקודת מוצא למיון טקסט או משימות הבנה בסינית. יש לו מעל שלוש מאות אלף הורדות, כך שהוא הפך לאחד מעמודי התווך של עיבוד סינית בקהילת הקוד הפתוח.

מתאים ל

  • השלמת מילים בטקסט סיני

    מבצע משימת fill-mask תוך התחשבות במילים שלמות ולא בתווים בודדים.

  • בסיס לסיווג טקסט בסינית

    משמש כבסיס יציב ומוכח לכוונון עדין על דאטה ייעודי של סנטימנט או נושאים.

  • חילוץ וקטורים לייצוג משפטים

    מפיק ייצוגים סמנטיים עמוקים לטקסטים קצרים בסינית עד 512 טוקנים.

איפה זה נופל

הוא מיועד לשפה הסינית בלבד. אם תזרקו עליו עברית, אנגלית או שפות מעורבות, הוא פשוט לא יידע מה לעשות איתן. חלון ההקשר שלו מוגבל ל־512 טוקנים, ולכן הוא לא מתאים למסמכים ארוכים או לספרים בלי חלוקה מוקדמת לפסקאות.

בנוסף, זהו מודל מסוג Masked LM שמיועד בעיקר להשלמת מילים או לחילוץ ייצוגים. הוא לא מודל שיחה, לא מחולל טקסט ארוך, ולא מסוגל לענות על שאלות חופשיות מחוץ לקופסה בלי אימון ייעודי נוסף.

שאלות
נפוצות

האם אפשר להשתמש בו לטקסטים בעברית או באנגלית?

לא. המודל אומן על טקסטים בסינית והמילון שלו נבנה סביב השפה הזו. לכל שפה אחרת צריך לבחור מודל רב-לשוני או כזה שאומן על אותה שפה.

מה ההבדל בין זה לבין מודל BERT סיני רגיל?

האימון נעשה באמצעות הסתרת מילים שלמות ולא תווים בודדים. זה מייצר הבנה עמוקה יותר של מבנה השפה והביטויים בסינית.

איך מריצים

המשקל הכולל מסתכם ב־1.1 ג'יגה בייט ב־11 קבצים, מה שאומר שאפשר להריץ אותו בקלות על מעבד רגיל או על כרטיס מסך פשוט יחסית עם פחות מ־4 ג'יגה זיכרון. טוענים אותו ישירות בקוד באמצעות BertForMaskedLM מספריית transformers בלי צורך בהגדרות מיוחדות.

אם אתם צריכים רק לחזות כמה מילים בודדות פעם ב, אין שום סיבה להחזיק שרת ייעודי או לשלם על תשתית קבועה. מנגד, בעומסי עבודה כבדים הגודל הקומפקטי שלו מאפשר להרים שרת עצמאי בזול בלי תלות בספקי ענן חיצוניים.

from transformers import pipeline

pipe = pipeline("fill-mask", model="hfl/chinese-bert-wwm")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מאפשר שימוש מסחרי מלא וחינמי. אתם יכולים לשלב אותו במוצר סגור, לשנות את הקוד ולהפיץ אותו, בתנאי שתשמרו על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗