GPT
B

bart-large-chinese

קוד פתוח

OpenMOSS-Teamרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • safetensors
  • bart
  • text2text-generation

גרסה ייעודית של ארכיטקטורת BART לסינית, שמתאימה למשימות של עיבוד והפקת טקסט. היא כוללת הרחבה לסינית מסורתית ומיועדת למי שצריך תשתית מקומית לשפה הזו.

  • 407Mפרמטרים
  • 1,024טוקנים בהקשר
  • 3.0 GBמשקל הקבצים
  • 2,375הורדות בחודש

מה זה

מדובר במודל סדרתי מסוג Sequence-to-Sequence עם 12 שכבות שמבוסס על ארכיטקטורת BART, ומיועד להבנה ויצירה של טקסט בסינית. בגרסה הזו הרחיבו את אוצר המילים ל־51,271 טוקנים כדי לכסות מעל 6,800 תווים סיניים נוספים, בעיקר סימנים מסורתיים, ניקו טוקנים כפולים והגדילו את חלון ההקשר מ־512 ל־1,024 טוקנים.

במדדי ההערכה הרשמיים, הגרסה המעודכנת של BART Large מגיעה לממוצע של 60.71 נקודות. היא רושמת שיפור קל במשימות תמצות כמו CSL-sum ו־LCSTS, וציון של 75.81 במשימת AFQMC. היוצרים עצמם מציינים שהאימון הנוסף של 50,000 צעדים לא הניב קפיצת מדרגה דרמטית בביצועים, ובחלק מהבדיקות כמו IFLYTEK התוצאה אפילו נמוכה במעט מהגרסה הקודמת.

מתאים ל

  • תמצות טקסטים בסינית

    מתאים לתמצות מסמכים קצרים בסינית מסורתית ומפושטת בזכות תוצאות סבירות במדדי CSL-sum ו־LCSTS.

  • השלמת משפטים והסקה

    מבצע שחזור והשלמת טוקנים חסרים בטקסט סיני, כפי שנבדק במשימות AFQMC מבוססות הקשר.

  • כוונון עדין למשימות תוכן

    בסיס קל משקל יחסית למי שרוצה לאמן מודל פנימי למשימות סיווג ויצירת שפה בסינית על חומרה צנועה.

איפה זה נופל

המודל מוגבל אך ורק לשפה הסינית עם תמיכה מסוימת במילים באנגלית, ואין לו שום תמיכה בעברית. חלון ההקשר עומד על 1,024 טוקנים בלבד, מה שמגביל מאוד ניתוח של מסמכים ארוכים.

בנוסף, הכרטיס מדגיש שחלק ממשימות ההמשך רגישות מאוד להיפר־פרמטרים של הכוונון העדין. אם לא מבצעים fine-tuning מוקפד, המודל עלול לתת תוצאות פחות טובות מהמצופה, ואינו מתאים כמנוע שיחה גנרי מודרני מחוץ לקופסה.

שאלות
נפוצות

באיזה טוקנייזר צריך להשתמש כדי להריץ אותו?

חובה להשתמש ב־BertTokenizer של transformers ולא בטוקנייזר המקורי של BART. הצוות החליף את המילון במילון מותאם לסינית, וטוקנייזר אחר ייצור שיבושים בטקסט.

האם המודל מבין או מייצר עברית?

לא. המודל אומן ספציפית על סינית ומכיל מעט מילים באנגלית לצמצום חריגות. אין לו יכולת לעבד או להפיק עברית.

איך מריצים

המודל שוקל כ־3 גיגה־בייט, כך שכרטיס מסך בסיסי עם 6 עד 8 גיגה־בייט של זיכרון יספיק לחלוטין להסקה שוטפת. הטעינה נעשית ישירות דרך ספריית transformers עם BartForConditionalGeneration, אבל חובה להשתמש ב־BertTokenizer ולא בטוקנייזר הרגיל של BART, בגלל מבנה המילון המותאם.

למשימות נקודתיות בסינית, גודל כזה של 407 מיליון פרמטרים רץ בקלות על שרת מקומי קטן. אין צורך לפנות ל־API חיצוני רק בשביל ביצועים, אלא אם אתם לא רוצים להתעסק עם ניהול תלויות וטעינת קבצי מודל עצמאית.

from transformers import pipeline

pipe = pipeline("text-generation", model="OpenMOSS-Team/bart-large-chinese")
print(pipe("שלום"))

הקבצים

8 קבצים במאגר, 3.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצרים לא ציינו רישיון בעמוד המודל. מבחינה משפטית, היעדר רישיון מוגדר משמעו שכל הזכויות שמורות, ולא ברור אם מותר להשתמש בו במוצר מסחרי או לשלב אותו במערכות פנימיות. לשימוש מסחרי מומלץ לפנות לצוות OpenMOSS או לחפש חלופה עם רישיון פתוח ברור.

הרישיון המלא בעמוד המודל ↗