GPT
I

indobert-base-p1

קוד פתוח

indobenchmarkmit2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

מודל שפה קלאסי שמיועד ספציפית לעיבוד טקסטים באינדונזית. הוא מייצר ייצוגים וקטוריים מדויקים למי שבונה חיפוש סמנטי או סיווג בשפה הזו, בלי לגרור מודלים רב לשוניים כבדים.

  • 512טוקנים בהקשר
  • 1.5 GBמשקל הקבצים
  • 366,585הורדות בחודש
  • 54לייקים

מה זה

מדובר במימוש של ארכיטקטורת BERT סטנדרטית עם 12 שכבות וכ־124.5 מיליון פרמטרים, שאומן כולו על קורפוס אינדונזי ייעודי בשם Indo4B בגודל של כמעט 23 וחצי ג'יגה בייט של טקסט. בניגוד למודלים רב לשוניים כמו mBERT שמפזרים את אוצר המילים שלהם על עשרות שפות, כאן כל מרחב הטוקנים מוקדש כולו לאינדונזית, מה שנותן הבנה טבעית בהרבה של המבנה הדקדוקי ומילות הסלנג המקומיות.

האימון נעשה במתכונת הרגילה של חיזוי מילים מוסתרות וחיזוי המשפט הבא. הגרסה הזו מוגדרת כשלב ראשון uncased, כלומר המודל מתעלם מאותיות גדולות וקטנות. עבור מי שמחפש מודל בסיס לחילוץ מאפיינים ועיבוד ייצוגים טקסטואליים, הוא מציע פתרון ממוקד מאוד וחסכוני במשאבים, שמשרת בדיוק את השוק הרלוונטי.

מתאים ל

  • סיווג טקסטים באינדונזית

    חילוץ ייצוגים וקטוריים לצורך אימון מסווג לניתוח רגשות, זיהוי כוונות משתמש או מיון פניות שירות באינדונזית.

  • חיפוש סמנטי מקומי

    יצירת אמבדינגס למאגרי מידע ומסמכים כדי לאפשר חיפוש מבוסס משמעות באינדונזית בתוך חלון של עד 512 טוקנים.

  • השלמת מילים מוסתרות

    שימוש במשימת השפה המקורית כדי להשלים מילים חסרות בטקסטים או לתיקון שגיאות כתיב והקלדה.

איפה זה נופל

המודל מוגבל לשפה האינדונזית בלבד. הוא לא יודע עברית ולא מיועד לטקסטים באנגלית, למעט מילים בודדות שחדרו לאינדונזית. בנוסף, חלון ההקשר עומד על 512 טוקנים בלבד, מה שמונע ממנו לנתח מסמכים ארוכים ברצף בלי לחתוך אותם מראש. המודל גם לא מיועד ליצירת טקסט חופשי אלא לחילוץ ייצוגים, כך שאם אתם בונים צ'אטבוט גנרטיבי, זה לא הכלי הנכון.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לטקסטים בעברית?

לא. המודל אומן בלעדית על טקסטים באינדונזית מקורפוס Indo4B. הוא לא מכיר את האלפבית העברי ולא מסוגל להבין או לעבד משפטים בעברית בשום צורה.

מה ההבדל בין גרסת p1 לגרסאות האחרות שמופיעות בטבלה?

גרסת p1 מייצגת את שלב האימון הראשון של המודל, מתוך משפחה הכוללת גם שלב שני p2 וגרסאות מוקטנות ומורחבות. לכולן אותם נתוני אימון בסיסיים אך הן שונות בהיקף הפרמטרים או בשלב האימון המדויק.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות BertTokenizer ו־AutoModel. הקבצים שוקלים כ־1.5 ג'יגה בייט, כך שאפשר להריץ אותו בקלות על מעבד רגיל בכל מחשב פיתוח, או על כרטיס מסך בסיסי וזול אם רוצים לבצע הסקה בכמויות גדולות או להמשיך לאימון fine tuning.

היוצרים שחררו גם גרסאות lite קטנות של 11.7 מיליון פרמטרים, וגם מודלים מורחבים של 335.2 מיליון פרמטרים. אם התקציב לחוץ במיוחד או שאתם מריצים במכשיר קצה, גרסאות ה־lite עדיפות, אבל עבור שרת סטנדרטי גרסת ה־base הזו מספקת את נקודת האיזון הנכונה בלי סיבה לפנות ל־API חיצוני יקר.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="indobenchmark/indobert-base-p1")
print(pipe("שלום"))

הרישיון

המודל משוחרר ברישיון MIT. זה הרישיון הכי פתוח שיש: מותר להשתמש בו לכל מטרה, כולל מוצרים מסחריים וסגורים, לשנות אותו ולהפיץ אותו חופשי. התנאי היחיד הוא שמירת הודעת זכויות היוצרים המקורית בתוך קוד המערכת.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗