GPT
C

chinese-macbert-base

קוד פתוח

hflapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

גרסה סינית לברט שמחליפה מילים דומות במקום להסתיר אותן במסכה. היא פותרת את הפער הקבוע בין שלב האימון המקדים לבין השימוש האמיתי בטקסט שוטף.

  • 512טוקנים בהקשר
  • 1.2 GBמשקל הקבצים
  • 17,560הורדות בחודש
  • 172לייקים

מה זה

במקום להשתמש בטוקן מסכה רגיל שנעלם לחלוטין כשמגיעים לעבודה מול משתמשים, המודל הזה אומן בשיטה של תיקון טקסט. בזמן האימון החליפו מילים במילים נרדפות בעזרת כלי מבוסס וורד-טו-וק, והרשת הייתה צריכה לזהות ולתקן אותן. בנוסף שילבו כאן מיסוך של מילים שלמות, ביטויי אן-גרם, וחיזוי סדר משפטים כדי לשפר את התפיסה של קשרים רחבים יותר.

המבנה הבסיסי נשאר בדיוק ברט רגיל של 12 שכבות. המשמעות היא שאין צורך בקוד מיוחד או בשכבות מותאמות כדי להריץ אותו, אלא אפשר פשוט להפיל אותו לתוך כל תשתית סינית קיימת שבנויה למודלים מהמשפחה הזו ולקבל נקודת פתיחה מדויקת יותר.

מתאים ל

  • תיקון שגיאות כתיב בסינית

    האימון המקורי התבסס על איתור מילים נרדפות והחלפתן, מה שהופך אותו לטבעי במיוחד לזיהוי ותיקון שגיאות הקלדה.

  • השלמת טוקנים חסרים בטקסט

    הארכיטקטורה מכוונת ישירות למשימת מילוי מסכות בתוך משפטים של עד 512 טוקנים בסינית.

  • בסיס למשימות סיווג בסינית

    אפשר להשתמש במשקלים שלו כנקודת מוצא להתאמה אישית למשימות סיווג רגש או ניתוח כוונות.

איפה זה נופל

הוא מוגבל לסינית בלבד, כך שטקסטים בעברית או באנגלית לא רלוונטיים כאן. חלון ההקשר עומד על 512 טוקנים, מה שחוסם עיבוד של מסמכים ארוכים או חוזים ברצף אחד בלי לחתוך אותם מראש. בנוסף, זה מודל שמיועד למשימות הבנה והשלמת טוקנים, ולא מודל שמייצר תשובות ארוכות או מנהל שיחה כמו מודלי שפה מודרניים.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לטקסטים בעברית?

לא. המודל אומן ספציפית על השפה הסינית והאוצר מילים שלו מותאם רק לשפה הזו. טקסט בעברית פשוט לא יעבוד.

האם צריך מחשב חזק במיוחד כדי להריץ אותו?

לא, מדובר במודל בסיס ששוקל 1.2 גיגה-בייט בלבד. אפשר להריץ אותו להסקה על מעבד מודרני ממוצע או על כרטיס מסך פשוט וזול.

איך מריצים

טוענים אותו ישירות דרך ספריית הטרנספורמרס הרגילה עם הפונקציות שמיועדות לברט. עם משקל של 1.2 גיגה-בייט, לא צריך פה שרת כבד במיוחד. הוא רץ בלי בעיה על מעבד רגיל, אבל אם רוצים זמני תגובה אפסיים או אימון המשך, עדיף לזרוק אותו על כרטיס מסך בסיסי עם לפחות 4 או 6 גיגה זיכרון.

אם כל מה שאתם צריכים זה קריאה בודדת מדי פעם, אפשר להסתמך על אנדפוינט מנוהל חיצוני. מצד שני, בגלל שהגודל שלו צנוע ואין תלויות חריגות, קל ומשתלם להרים אותו מקומית בקונטיינר בלי לשלם פר קריאה לספק ענן.

from transformers import pipeline

pipe = pipeline("fill-mask", model="hfl/chinese-macbert-base")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון אפאצ'י 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצר פנימי או מסחרי. הדרישה העיקרית היא שמירה על הודעת הרישיון המקורית ומתן קרדיט ליוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗