GPT
B

bert-base-arabertv2

קוד פתוח

aubmindlabרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • safetensors

גרסה שנייה למודל שפה מבוסס ברט המיועד לערבית ומסתמך על חלוקה מורפולוגית מוקדמת. הוא מתאים למי שבונה משימות סיווג, זיהוי ישויות או מענה לשאלות בערבית וזקוק לבסיס מאומן היטב.

  • 136Mפרמטרים
  • 512טוקנים בהקשר
  • 2.7 GBמשקל הקבצים
  • 12,555הורדות בחודש

מה זה

מדובר במודל שמיישם את ארכיטקטורת ברט המקורית בגודל בסיס עם שנים עשר שכבות, אבל הוכשר במיוחד על קורפוס ערבי עצום של שבעים ושבעה ג'יגה בייט המכיל מעל שמונה וחצי מיליארד מילים. הדאטה כולל את ויקיפדיה בערבית, ארכיון עיתונות וסריקות רשת מסוננות. בניגוד לגרסאות רב לשוניות כלליות שכוללות ערבית רק כשפה אחת מתוך רבות, המודל הזה מתמקד לחלוטין בדקדוק ובמבנה המורפולוגי של השפה הזו.

ההבדל המשמעותי בגרסה הזו הוא אופן הטיפול במילים. הטקסט עובר פירוק מקדים באמצעות כלי בשם פארסה, שמפריד אותיות יחס, תחיליות וסיומות מגוף המילה לפני שהטוקנייזר מעבד אותן. ההפרדה הזו פותרת את בעיית העושר המורפולוגי בערבית, שבה מילה אחת יכולה להכיל משפט שלם, ועוזרת לו להבין הקשרים תחביריים טוב יותר בהשוואה לגרסאות ללא חלוקה.

מתאים ל

  • סיווג טקסט וניתוח רגשות

    זיהוי סנטימנט בביקורות או פוסטים בערבית לאחר כוונון עדין על מאגר נתונים ייעודי.

  • זיהוי ישויות בערבית

    שליפת שמות, ארגונים ומקומות מתוך טקסטים חדשותיים ומאמרים תוך הבנת התחיליות.

  • מענה לשאלות מבוסס הקשר

    איתור התשובה הנכונה מתוך פסקה נתונה במערכות חיפוש פנימיות בערבית.

איפה זה נופל

החיסרון המרכזי כאן הוא התלות המוחלטת בעיבוד המקדים. אתם חייבים להריץ את ספריית פארסה על כל קלט לפני שהוא מגיע למודל, מה שמוסיף עיכוב בזמן הריצה ומסבך את תהליך הפריסה בשרת. אם תשלחו טקסט רגיל בלי ההפרדות של התחיליות, הביצועים יירדו בצורה חדה.

בנוסף, חלון ההקשר מוגבל לחמש מאות ושניים עשר טוקנים בלבד. הוא לא יקרא מסמכים ארוכים ברצף ולא יסכם ספרים. המשימה המקורית שלו היא השלמת מילים מוסתרות בלבד, כך שכדי לקבל ממנו ערך מעשי כמו ניתוח רגשות או חילוץ שמות, חובה לבצע אימון נוסף עם שכבת פלט מתאימה.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה ישירות לצ'אט או לכתיבת תוכן?

לא. מדובר במודל ממשפחת ברט שמיועד להבנת שפה והשלמת מילים חסרות, ולא במודל יוצר כמו גי פי טי. הוא נועד לשמש תשתית למשימות סיווג, תיוג וחיפוש ולא לניהול שיחה.

מה ההבדל בינו לבין גרסת v0.2 של אותו צוות?

גרסה שתיים הרגילה דורשת חלוקה מורפולוגית מקדימה של מילים בעזרת כלי חיצוני, בעוד גרסת v0.2 מקבלת טקסט רגיל ללא פילוח מקדים. החלוקה המוקדמת משפרת דיוק במשימות מורכבות אך דורשת שלב עיבוד נוסף.

האם המודל תומך בשפות נוספות מלבד ערבית?

הוא אומן אך ורק על טקסטים בערבית. לא מומלץ להשתמש בו לטקסטים בעברית או באנגלית, שכן אוצר המילים והמשקלים שלו מותאמים באופן בלעדי למבנה של השפה הערבית.

איך מריצים

בזכות גודל של מאה שלושים ושישה מיליון פרמטרים, המודל הזה קל מאוד להרצה מקומית. כרטיס מסך בסיסי עם ארבעה עד שמונה ג'יגה בייט של זיכרון יספיק לחלוטין להסקה וגם לכוונון עדין של שכבות הסיווג. אפשר להריץ אותו גם על מעבד רגיל של שרת אם זמני התגובה אינם קריטיים לרמת המילישניות.

אם אתם צריכים לאמן אותו מחדש על דאטה גדול במיוחד, עדיף לפנות לשרתי ענן עם מעבדי טי פי יו או כרטיסים גרפיים חזקים. ההרצה דורשת התקנה של חבילת פייתון ייעודית לפילוח הטקסט לפני השליחה למודל, ולכן אי אפשר להזין אליו מחרוזות גולמיות ישירות.

from transformers import pipeline

pipe = pipeline("fill-mask", model="aubmindlab/bert-base-arabertv2")
print(pipe("שלום"))

הרישיון

הרישיון של המודל לא דווח בדף שלו. בפועל, היעדר רישיון רשמי ומוגדר אומר שאין אישור משפטי מפורש לשימוש מסחרי או להפצה בתוך מוצר סגור. אם אתם מתכננים לשלב אותו במערכת מסחרית, תצטרכו לבדוק את תנאי המאמר המקורי או ליצור קשר ישיר עם החוקרים שפרסמו אותו כדי למנוע חשיפה לתביעות זכויות יוצרים.

הרישיון המלא בעמוד המודל ↗