GPT
C

chinese-macbert-large

קוד פתוח

hflapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

גרסה מורחבת של BERT לסינית שמחליפה מילים במילים נרדפות במקום להסתיר אותן. היא מתאימה למי שצריך ייצוג מדויק של טקסט סיני למשימות סיווג או תיקון שגיאות.

  • 512טוקנים בהקשר
  • 3.7 GBמשקל הקבצים
  • 79,255הורדות בחודש
  • 56לייקים

מה זה

במקום להסתיר מילים עם טוקן ייעודי של מסכה כמו בברט הרגיל, המודל הזה אומן בשיטה של תיקון טקסט. החוקרים לקחו מילים דומות ממאגר מילים נרדפות והחליפו אותן בתוך המשפט, כך שהרשת לומדת לזהות ולתקן שגיאות במקום לנחש חללים ריקים שלא קיימים בטקסט אמיתי בזמן שימוש שוטף.

חוץ משיטת האימון הזו, שולבו כאן מיסוך של מילים שלמות, ביטויים שלמים וחיזוי סדר משפטים. הארכיטקטורה עצמה נשארה זהה לחלוטין לברט עם 24 שכבות, ולכן אפשר להחליף מודל קיים בלי לשנות את קוד הטעינה או את מבנה הצינור שלכם.

מתאים ל

  • תיקון שגיאות כתיב בסינית

    שיטת האימון התבססה על החלפת מילים נרדפות, ולכן הוא רגיש במיוחד לזיהוי ותיקון שגיאות החלפה.

  • סיווג טקסטים בסינית

    מבנה של 24 שכבות נותן ייצוג עמוק שמתאים למשימות הבנה וסיווג של טקסטים קצרים.

  • השלמת מילים חסרות

    הארכיטקטורה תומכת ישירות במשימות fill mask לפי ההקשר התחבירי של המשפט.

איפה זה נופל

המודל מוגבל לחלון של 512 טוקנים, מה שאומר שהוא לא מתאים למסמכים ארוכים בלי חיתוך מקדים. בנוסף, הוא אומן על סינית בלבד, כך שטקסטים בעברית, באנגלית או בכל שפה אחרת פשוט לא יעבדו כאן. אם המשימה שלכם כוללת קלטים מעורבים, תצטרכו לנקות אותם קודם או לחפש מודל רב לשוני.

שאלות
נפוצות

האם אפשר להשתמש בו לטקסט מעורב של סינית ואנגלית?

הכרטיס מגדיר תמיכה בשפה הסינית בלבד. אם תזינו מילים באנגלית או בעברית, הייצוג שלהן יהיה חלקי או משובש ולא כדאי להסתמך עליו במוצר.

במה שונה הטעינה שלו ממודל BERT רגיל?

אין שום הבדל בקוד. המפתחים שמרו על הארכיטקטורה המקורית של ברט, כך שטוענים אותו עם אותן פונקציות מוכרות בספריית transformers.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers עם המחלקות הרגילות של BertForMaskedLM או BertModel. הקבצים שוקלים 3.7 גיגה בייט, כך שתצטרכו כרטיס מסך עם לפחות 8 עד 12 גיגה בייט זיכרון כדי להריץ הסקת מסקנות בצורה חלקה, והרבה יותר מזה אם אתם מתכננים אימון נוסף.

אם יש לכם שרת עם מאיץ גרפי מתאים, הרצה מקומית תיתן לכם שליטה מלאה ופרטיות למידע. אם אין לכם חומרה כזו או שמדובר בפרויקט נקודתי שלא מצדיק תחזוקת שרת, שירות ענן מנוהל שחוסך את ניהול הזיכרון יהיה פתרון פשוט וזול יותר.

from transformers import pipeline

pipe = pipeline("fill-mask", model="hfl/chinese-macbert-large")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו כחלק ממוצר סגור, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗