GPT
B

banglabert

קוד פתוח

csebuetnlpרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • electra
  • pretraining
  • bn

מודל אלקטרה ייעודי לבנגלית שמיועד למשימות הבנה וסיווג טקסט. הוא עוקף מודלים רב-לשוניים כבדים בהרבה ומספק בסיס מדויק לעבודה ישירה בשפה.

  • 512טוקנים בהקשר
  • 423 MBמשקל הקבצים
  • 59,551הורדות בחודש
  • 44לייקים

מה זה

מדובר במודל מסוג דיסקרימינטור של אלקטרה עם 110 מיליון פרמטרים ו־12 שכבות, שאומן ספציפית על בנגלית בשיטת זיהוי טוקנים מוחלפים. הוא לא מייצר טקסט חופשי, אלא נועד לשמש בסיס לכוונון עדין במשימות הבנת שפה קלאסיות כמו סיווג רגשות, זיהוי ישויות, היקש לוגי ומענה על שאלות מתוך טקסט.

במבחני ביצועים מפוקחים, המודל הזה השיג ציון BangLUE של 77.09, ועקף לא רק מודלים ייעודיים אחרים אלא גם מודלי ענק רב-לשוניים כמו XLM-RoBERTa Large שמחזיק 550 מיליון פרמטרים. במשימות של סיווג רגשות הוא מוביל עם 72.89 ב־F1 מאקרו, ובהיקש לוגי הוא עומד על 82.80 דיוק. היתרון הזה מראה שאימון ייעודי וממוקד על שפה אחת עובד טוב יותר מחלוקת משאבים על עשרות שפות במקביל.

מתאים ל

  • סיווג רגשות בבנגלית

    מגיע לתוצאה של 72.89 במדד F1 מאקרו, ועוקף מודלים כבדים בהרבה בניתוח טקסטים קצרים.

  • חילוץ ישויות מטקסט

    מתאים לזיהוי שמות, מקומות וארגונים במסמכים בשפה הבנגלית עם דיוק F1 של 77.78.

  • מענה על שאלות

    מאתר תשובות מדויקות מתוך פסקאות נתונות עם ציון F1 של 79.34 על בסיס נתונים קיים.

איפה זה נופל

הנקודה הקריטית ביותר היא התלות בצינור הנרמול של היוצרים. המודל אומן על טקסט שעבר עיבוד דרך ספריית נרמול ייעודית, ואם תזינו לו טקסט בנגלית גולמי בלי השלב הזה, הביצועים יירדו ישירות. חלון ההקשר מוגבל ל־512 טוקנים, מה שפוסל ניתוח של מסמכים ארוכים ברצף.

בנוסף, הוא מבין רק בנגלית. הוא לא מתאים לעברית, לא לאנגלית, ולא יודע לייצר טקסט חדש או לנהל שיחה, אלא רק לתייג ולסווג קלטים קיימים.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לשיחה או לכתיבת מיילים?

לא. המודל בנוי בארכיטקטורת אלקטרה דיסקרימינטור, שמתאימה לסיווג והבנה ולא ליצירת טקסט חדש. הוא מנתח מילים קיימות ולא פולט משפטים.

מה חובה לעשות לפני שמעבירים לו טקסט לטוקניזציה?

חובה להעביר את הטקסט דרך ספריית הנרמול הייעודית של היוצרים בגיטהאב. המודל אומן לפי הכללים האלה, ודילוג על השלב יפגע ישירות בדיוק התוצאות.

איך מריצים

המשקל הכולל של הקבצים עומד על 423 מגה-בייט, כך שאפשר להריץ אותו בקלות על מעבד רגיל של שרת פשוט או מחשב פיתוח, בלי צורך במאיץ גרפי כבד. טוענים אותו ישירות דרך ספריית transformers בפייתון כמודל אלקטרה.

בגלל המשקל הנמוך שלו, אין שום סיבה להשתמש ב־API חיצוני או לשלם לספק ענן על שירות מנוהל. הוא מיועד לריצה מקומית, אבל קחו בחשבון שמדובר במשקלי בסיס שצריך לאמן על המידע שלכם לפני שמקבלים תוצאות שימושיות.

from transformers import pipeline

pipe = pipeline("text-generation", model="csebuetnlp/banglabert")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 423 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצרים לא דיווחו על רישיון שימוש במאגר. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בו במוצר מסחרי או להפיץ אותו. אם אתם בונים מערכת פנימית או מסחרית, אי אפשר להסתמך עליו בבטחה עד שהיוצרים יבהירו את התנאים.

הרישיון המלא בעמוד המודל ↗