GPT
M

macbert4csc-base-chinese

קוד פתוח

shibing624apache-2.02022-03-02

  • transformers
  • pytorch
  • onnx
  • safetensors
  • bert

המודל הזה מזהה ומתקן שגיאות כתיב והחלפת תווים בטקסטים בסינית בלבד. הוא מיועד למי שצריך בדיקת איות מדויקת ומהירה בסינית בלי להחזיק מודלי ענק יקרים.

  • 102Mפרמטרים
  • 512טוקנים בהקשר
  • 1.2 GBמשקל הקבצים
  • 537,570הורדות בחודש

מה זה

מדובר במודל שמבוסס על ארכיטקטורת BERT עם 102 מיליון פרמטרים, שעבר התאמה ייעודית למשימת תיקון איות בסינית (Chinese Spelling Correction). הוא נשען על שיטת MacBERT שמחליפה מילים דומות במקום להשתמש רק במסכות רגילות, ומבנה הרשת שואב השראה מ־SoftMaskedBERT. הוא מקבל משפט עם שגיאות הקלדה, מזהה את התווים הבעייתיים ומחזיר את הגרסה המתוקנת.

במבחן SIGHAN2015 ברמת התו הבודד, המודל מציג דיוק (Precision) של 93.72 ואחזור (Recall) של 86.40, עם ציון F1 של 89.91. ברמת המשפט השלם, שבה כל שגיאה מפילה את התוצאה, הדיוק עומד על 82.64 והאחזור על 73.66. המספרים האלה מראים שהוא מצליח לתפוס ולתקן את רוב שגיאות הכתיב הנפוצות במשפט, אבל הוא מפספס בערך רבע מהמשפטים שדורשים תיקון מלא.

מתאים ל

  • תיקון קלט משתמשים בסינית

    ניקוי שגיאות הקלדה בחיפושים או בטפסים לפני שליחה למנוע חיפוש פנימי.

  • בדיקת איות לצ'אטים

    זיהוי והחלפה מהירה של תווים שגויים בהודעות טקסט קצרות בזמן אמת.

  • עיבוד מקדים לטקסט מ־OCR

    תיקון טעויות זיהוי תווים שנבעו מסריקת מסמכים בסינית.

איפה זה נופל

הבעיה העיקרית היא שהמודל אומן ונבדק על מערכי נתונים ספציפיים מאוד, בעיקר SIGHAN ו־Wang271K, מה שאומר שהביצועים הגבוהים שלו נמדדו בתנאי מעבדה שדומים למידע שעליו הוא למד. אם הטקסט שלכם כולל סלנג מודרני, שמות מותגים חדשים או מונחים טכניים שלא היו בקורפוס, שיעור הדיוק ירד. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים, כך שהוא לא בנוי לסריקת מסמכים ארוכים במכה אחת אלא למשפטים בודדים בלבד.

שאלות
נפוצות

האם המודל תומך בתיקון שגיאות בעברית או באנגלית?

לא. המודל אומן אך ורק על השפה הסינית והאוצר מילים שלו מותאם לה לחלוטין. הוא לא יודע להתמודד עם שפות אחרות.

האם הוא מתאים לתיקון מאמרים ומסמכים שלמים?

לא באופן ישיר. המודל מוגבל לחלון של 512 טוקנים, ולכן תצטרכו לפרק את המסמך למשפטים בודדים, להזין אותם בנפרד ולחבר את התוצאות מחדש.

איך מריצים

המודל שוקל 1.2 גיגה־בייט ונשען על ספריית transformers הסטנדרטית, כך שאפשר להריץ אותו ישירות בפייתון או דרך חבילת pycorrector הייעודית של אותו מפתח. עם 102 מיליון פרמטרים וחלון הקשר של 512 טוקנים, אין שום צורך בכרטיסי מסך כבדים. מעבד רגיל של שרת מקומי או ענן יריץ אותו בקלות, ובשימוש ב־GPU בסיסי תקבלו זמני תגובה של מילישניות בודדות.

אין שום סיבה לשלם ל־API חיצוני כדי לקבל שירות כזה. העלות של הרצה עצמית אפסית ביחס לתוצאה, וההתקנה מסתכמת בטעינת המודל מקבצי המשקלים.

from transformers import pipeline

pipe = pipeline("text-generation", model="shibing624/macbert4csc-base-chinese")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו הלאה, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗