GPT
B

bert-base-arabertv02

קוד פתוח

aubmindlabרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • tensorboard

מודל שפה בגודל קומפקטי שנבנה מאפס להבנת ערבית. הוא עובד ישירות על טקסט גולמי בלי לדרוש חיתוך מורפולוגי מוקדם של מילים.

  • 136Mפרמטרים
  • 512טוקנים בהקשר
  • 2.8 GBמשקל הקבצים
  • 572,031הורדות בחודש

מה זה

מדובר בגרסת BERT Base עם 136 מיליון פרמטרים ו־12 שכבות, שפותחה במעבדת המוח והבינה המלאכותית של האוניברסיטה האמריקאית בביירות. המטרה העיקרית שלו היא השלמת מילים מוסתרות בטקסט וייצוג הקשרי של השפה הערבית, תוך התמודדות טובה יותר עם מבנה השפה בהשוואה למודלים רב־לשוניים כלליים כמו mBERT.

גרסה זו אומנה על מאגר של כ־77 גיגה־בייט הכולל מעל 8.6 מיליארד מילים, שנגזרו מויקיפדיה הערבית, קורפוס OSCAR ומאמרי חדשות. הייחוד של סדרת 0.2 מול גרסאות v2 המקבילות הוא היעדר הצורך בסגמנטציה באמצעות Farasa. אתם מקבלים מודל שאומן על מילים שלמות, עם אוצר מילים מעודכן שבו הופרדו סימני פיסוק ומספרים.

מתאים ל

  • סיווג טקסטים בערבית

    זיהוי נושאים או ניתוח סנטימנט בטקסטים סטנדרטיים, בלי צורך בעיבוד מורפולוגי מורכב.

  • זיהוי ישויות שמיות

    שליפת שמות, מקומות וארגונים מתוך כתבות חדשותיות ומסמכים רשמיים בערבית תקנית.

  • מענה על שאלות

    איתור תשובות בתוך פסקאות קצרות הודות לאימון על מאגרי שאלות ותשובות בערבית.

איפה זה נופל

חלון ההקשר מוגבל ל־512 טוקנים, ולכן הוא לא מתאים לעיבוד מסמכים ארוכים ברצף. הוא גם לא מיועד ליצירת טקסט חופשי אלא רק למשימות של קידוד, סיווג והשלמת מילים. בנוסף, המודל אומן בעיקר על ערבית תקנית מודרנית ממקורות חדשותיים ואנציקלופדיים. אם הדאטה שלכם מכיל דיאלקטים מקומיים, סלנג או טקסטים מרשתות חברתיות, הוא יתקשה לעבד אותם, ובמקרים כאלה עדיף לבחון את גרסת הטוויטר הייעודית.

שאלות
נפוצות

מה ההבדל בינו לבין גרסת bert-base-arabertv2?

גרסת v2 הרגילה מחייבת חיתוך מורפולוגי של תחיליות וסופיות באמצעות כלי חיצוני לפני ההזנה למודל. גרסת v02 הקיימת כאן עובדת על מילים שלמות ללא סגמנטציה מוקדמת, מה שמפשט את תהליך העבודה וחוסך שלב עיבוד.

האם המודל תומך בעברית?

לא. המודל אומן באופן בלעדי על טקסטים בשפה הערבית. אוצר המילים והמשקלים שלו אינם מכילים ייצוגים המתאימים לעברית.

איך מריצים

המשקל הכולל של הקבצים עומד על 2.8 גיגה־בייט, כך שאפשר להריץ אותו בקלות על מעבד גרפי פשוט עם 6 עד 8 גיגה זיכרון, ואפילו על מעבד רגיל עבור הסקת מסקנות בקצב נמוך. הוא נתמך ישירות בספריית transformers וזמין בפורמטים של PyTorch ו־TensorFlow.

לפני שמזינים טקסט למודל, חובה להשתמש בפונקציית הניקוי מחבילת הפייתון הייעודית arabert. אם המערכת שלכם כבר מריצה מודלים באופן מקומי, אין שום סיבה לפנות ל־API חיצוני כי דרישות החומרה כאן נמוכות מאוד. מומלץ לשקול API מסחרי רק אם אתם צריכים לפרוס שירות מהר בלי לתחזק שרתים.

from transformers import pipeline

pipe = pipeline("fill-mask", model="aubmindlab/bert-base-arabertv02")
print(pipe("שלום"))

הרישיון

היוצרים לא הגדירו רישיון בדף המודל. מבחינה משפטית, היעדר רישיון מפורש משאיר את השימוש בו בשטח אפור, בלי היתר שימוש מסחרי מובטח. אם אתם מתכננים לשלב אותו במוצר מסחרי, תצטרכו לפנות ישירות ליוצרים במעבדה בביירות ולקבל מהם אישור כתוב לפני ההפצה.

הרישיון המלא בעמוד המודל ↗