GPT
C

chinese-bert-wwm-ext

קוד פתוח

hflapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

זהו מודל שמיועד להשלמת מילים והבנת טקסט בסינית עם מיסוך מילים שלמות. תבחרו בו כשאתם צריכים ייצוג שפתי מדויק לסינית ולא רוצים להסתפק במיסוך תווים בודדים.

  • 512טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 10,797הורדות בחודש
  • 196לייקים

מה זה

מדובר בעיבוד של ברט לסינית שנבנה על בסיס המחקר של גוגל, עם שינוי מהותי בתהליך האימון. במקום להסתיר תווים בודדים במהלך הלמידה, השתמשו בטכניקת Whole Word Masking שממסכת מילים שלמות. בסינית, שבה מילים מורכבות לרוב מכמה תווים, הגישה הזו מאלצת את המודל לתפוס הקשרים סמנטיים שלמים ולא רק לנחש את התו הבא לפי הרגל.

הוא מבוסס על שתים עשרה שכבות ומיועד למשימות של חיזוי טקסט מוסתר. המודל פותח על ידי צוות מחקר שפרסם עליו מאמרים ייעודיים, והוא מתאים כבסיס לעיבוד שפה טבעית בסינית כשרוצים דיוק גבוה יותר מזה של מודל ברט בסיסי.

מתאים ל

  • השלמת מילים בסינית

    חיזוי ביטויים חסרים בטקסט סיני על בסיס מילים שלמות ולא תווים בודדים.

  • חילוץ ייצוגים סמנטיים

    יצירת וקטורים מדויקים למשפטים בסינית לצורך משימות סיווג ומיון במורד הזרם.

  • אימון המשך למשימות ספציפיות

    נקודת מוצא טובה להתאמה על טקסטים עסקיים או טכניים בסינית קלאסית ומודרנית.

איפה זה נופל

הוא מוגבל אך ורק לשפה הסינית. אם תנסו לעבד איתו טקסטים בעברית או באנגלית, תקבלו תוצאות חסרות משמעות. מגבלה נוספת היא חלון ההקשר של 512 טוקנים, שמונע ממנו לנתח מסמכים ארוכים ברצף אחד בלי לחתוך אותם מראש. בנוסף, כרטיס המודל לא חושף ציוני ביצועים מדויקים או נתונים על דאטה סט האימון, כך שתצטרכו לבדוק בעצמכם איך הוא מתמודד עם ניבים או סלנג לפני שאתם משלבים אותו בפרודקשן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לניתוח טקסטים בעברית?

לא. המודל אומן ספציפית על סינית ומזהה רק אותה. כל ניסיון להזין לו עברית יסתיים בשגיאות או בפלט חסר ערך.

מה ההבדל המרכזי בינו לבין ברט סיני רגיל?

ההבדל הוא במיסוך המילים השלמות. בעוד שמודל רגיל מסתיר תווים בודדים, כאן המערכת אומנה להבין את המילה כולה, מה שמייצר תפיסה סמנטית טובה יותר לשפה.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות BertForMaskedLM. עם גודל קבצים של 1.1 גיגה בייט, אתם לא צריכים שרת מפלצתי. כרטיס גרפי בסיסי עם מעט זיכרון יספיק כדי להריץ אותו מקומית, ואפשר אפילו לבצע הסקת מסקנות על מעבד רגיל אם העומס נמוך.

אם אתם צריכים להריץ שאילתות בודדות פעם ביום, להקים עבורו תשתית זה בזבוז זמן, ועדיף להשתמש בנקודת קצה קיימת. אם יש לכם זרם קבוע של מסמכים בסינית או שאתם מתכננים לעשות לו התאמה אישית, הרצה עצמית פשוטה מאוד לתחזוקה ולא דורשת תקציב ענן כבד.

from transformers import pipeline

pipe = pipeline("fill-mask", model="hfl/chinese-bert-wwm-ext")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית כחלק ממוצר שלכם. הדרישה המרכזית היא לשמור על הצהרת זכויות היוצרים המקורית והודעת הרישיון, בלי להטיל עליכם חובה לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗