GPT
B

bart-base-chinese

קוד פתוח

OpenMOSS-Teamרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • safetensors
  • bart
  • text2text-generation

גרסה קומפקטית לסינית של ארכיטקטורת קידוד ופענוח, שמתאימה למשימות טקסט לטקסט כמו סיכום. המודל שוקל גיגה בודד ומכיל מילון מורחב שכולל תווים מסורתיים.

  • 140Mפרמטרים
  • 1,024טוקנים בהקשר
  • 1.0 GBמשקל הקבצים
  • 1,848הורדות בחודש

מה זה

מדובר במימוש של ארכיטקטורת BART בסינית עם שש שכבות וגודל בסיסי. הוא מבצע משימות של הבנה ויצירת טקסט, כמו השלמת מילים חסרות או סיכום מסמכים. העדכון שלו החליף את המילון הישן באחד שמכיל 51,271 פריטים, שכולל עוד כ־6,800 תווים סיניים ומספר מילים באנגלית כדי להפחית חוסרים, והכפיל את חלון ההקשר. המבחנים בכרטיס מראים שהעדכון שמר על רמה דומה לקודם עם ציון ממוצע של 58.64 לעומת 58.23, כשבחלק מהבדיקות כמו סיכום CSL יש אפילו ירידה קלה. המפתחים עצמם מציינים שאימון ההמשך לא הביא לשיפור משמעותי, כך שהיתרון האמיתי כאן הוא בעיקר התמיכה בטקסט ארוך יותר ובתווים נוספים ולא בקפיצת ביצועים.

מתאים ל

  • סיכום טקסטים קצרים בסינית

    המודל נבדק על מאגרי סיכום כמו LCSTS ומתאים להפקת תמציות מטקסטים של עד אלף טוקנים.

  • השלמת מילים וטקסט חסר

    ארכיטקטורת הקידוד והפענוח מאפשרת שחזור מקטעים חסרים ומשפטים פגומים בסינית מודרנית ומסורתית.

  • סיווג טקסט והבנת הנקרא

    מתאים למשימות מיון פשוטות כמו IFLYTEK על חומרה מקומית חלשה מאוד.

איפה זה נופל

המודל מיועד אך ורק לסינית ולא מתאים לשום שפה אחרת, בוודאי לא לעברית. חלון ההקשר מוגבל ל־1,024 טוקנים, כך שאי אפשר להזין אליו מסמכים שלמים או ספרים. בנוסף, המפתחים מודים בפירוש שאימון ההמשך לא הוביל לשיפור מהותי בתוצאות, ובחלק ממשימות ההבנה הוא אף מציג ביצועים נמוכים במעט מגרסאות מקבילות כמו CPT או גרסאות ה־Large.

שאלות
נפוצות

האם המודל תומך בעברית או באנגלית?

עברית לא נתמכת כלל. המודל מכיל מעט מילים באנגלית כדי להפחית שגיאות במילון, אך הוא נועד לעיבוד שפה סינית בלבד.

איזה טוקנייזר צריך להגדיר בקוד?

חובה להשתמש ב־BertTokenizer ולא ב־BartTokenizer הרגיל, כפי שמדגישים המפתחים בהוראות ההרצה שלהם.

איך מריצים

בזכות משקל של ג'יגה־בייט בודד ו־140 מיליון פרמטרים, כל מעבד גרפי פשוט ואפילו מעבד רגיל של מחשב נייד יריצו אותו בלי בעיה מקומית עם ספריית transformers. אין צורך בשרתים כבדים או בתשלום ל־API חיצוני אם יש לכם צורך בפרטיות מידע וריצה מקומית של משימות קצרות בסינית.

צריך לשים לב לשתי נקודות טכניות שמופיעות בהוראות. המודל דורש שימוש ב־BertTokenizer ולא בטוקנייזר הרגיל של BART, וכדי לעבוד עם הגרסה המעודכנת יש לעדכן את קובץ המידול ממאגר הגיטהאב שלהם ולרענן את המטמון של המילון.

from transformers import pipeline

pipe = pipeline("text-generation", model="OpenMOSS-Team/bart-base-chinese")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 1.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצרים לא דיווחו על רישיון שימוש בעמוד המודל. מבחינה משפטית, היעדר רישיון אומר שזכויות היוצרים שמורות במלואן למפתחים, ואין אישור מפורש להשתמש בו במוצר מסחרי או להפיץ אותו. כל שילוב שלו במערכת ייצור דורש פנייה ישירה אל OpenMOSS כדי לקבל היתר.

הרישיון המלא בעמוד המודל ↗