GPT
B

bert-base-parsbert-uncased

קוד פתוח

HooshvareLabרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

זה מודל BERT ייעודי לפרסית, שנבנה כדי לעבד ולהבין טקסטים בשפה הזו בצורה מדויקת יותר ממודלים רב-לשוניים כלליים.

  • 512טוקנים בהקשר
  • 2.1 GBמשקל הקבצים
  • 161,906הורדות בחודש
  • 47לייקים

מה זה

מדובר בגרסת BERT-Base שאומנה בלעדית על קורפוס פרסי של יותר מ־2 מיליון מסמכים ומעל 40 מיליון משפטים, תוך שילוב עיבוד מקדים של תיוג חלקי דיבר וחלוקת מילים. המודל מתמקד במשימת השלמת מילים חסרות בטקסט, ומשמש בסיס להתאמה למשימות עיבוד שפה שונות.

בבדיקות מול מודלים קיימים כמו mBERT, הוא הציג עדיפות עקבית. בניתוח סנטימנט הוא מגיע לציון F1 של 92.13 בסיווג בינארי, בסיווג טקסט של חדשות ל־97.19, ובזיהוי ישויות על מאגר ARMAN הוא רושם 98.79 מול 95.89 של mBERT. הפערים מראים שאימון ייעודי על שפה אחת עדיף משמעותית על פני חלוקת משאבי המודל בין עשרות שפות במקביל.

מתאים ל

  • סיווג תגובות בפרסית

    ניתוח סנטימנט וסיווג ביקורות גולשים באתרי מסחר עם תוצאות F1 מוכחות מעל 88.

  • זיהוי ישויות בטקסט

    חילוץ שמות ומונחים מתוך חדשות ומסמכים בפרסית בדיוק גבוה יותר מ־mBERT.

  • מיון מסמכים ומאמרים

    קטלוג אוטומטי של טקסטים ארוכים ואתרי תוכן לפי נושאים על בסיס ייצוג שפתי מקומי.

איפה זה נופל

זה אינו מודל שיחה או מודל שיוצר טקסטים ארוכים, אלא מודל ייצוג והשלמת מילים שדורש אימון נוסף לכל משימה מעשית. מעבר לכך, המודל מתמחה בפרסית בלבד ולא יתאים למי שמחפש פתרון לעברית או לערבית, למרות הדמיון באלפבית. חלון ההקשר שלו מוגבל ל־512 טוקנים, כך שטקסטים ארוכים במיוחד יחייבו חיתוך ועיבוד בחלקים.

שאלות
נפוצות

האם אפשר להשתמש בו לטקסטים בעברית בגלל הקשר הגאוגרפי?

לא. המודל אומן אך ורק על קורפוס פרסי, ואוצר המילים והמבנה שלו מותאמים לשפה הזו בלבד. לטקסטים בעברית יש צורך במודל שאומן על עברית כמו HeBERT או מודלים רב-לשוניים כלליים.

האם המודל מוכן לשימוש מיד כמסווג טקסט?

המשקולות הנוכחיות מאומנות על משימת השלמת מילים בלבד. כדי להשתמש בו לסיווג תוכן או ניתוח רגשות, תצטרכו להוסיף שכבת פלט מתאימה ולאמן אותו על סט נתונים ייעודי למשימה שלכם.

איך מריצים

המודל שוקל 2.1 גיגה-בייט ונשען על ארכיטקטורת 12 שכבות סטנדרטית של BERT עם חלון של 512 טוקנים. אפשר להריץ אותו בלי שום בעיה על כרטיס מסך בסיסי או אפילו על מעבד רגיל לצורך היסק, באמצעות ספריית transformers בפייתון עם PyTorch או TensorFlow.

אם אתם צריכים לאמן אותו מחדש למשימה ספציפית, כרטיס מסך מודרני בודד יספיק לרוב המאגרים. פתרון שרת מקומי מתאים כאן מאוד כי המשקל נמוך, ואין צורך אמיתי להסתמך על API חיצוני יקר אם יש לכם תשתית מחשוב בסיסית.

from transformers import pipeline

pipe = pipeline("fill-mask", model="HooshvareLab/bert-base-parsbert-uncased")
print(pipe("שלום"))

הקבצים

7 קבצים במאגר, 2.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצרים לא ציינו רישיון בעמוד המודל. המשמעות בפועל היא שאין אישור מפורש לשימוש מסחרי או הפצה מחדש בתוך מוצר, ולפני שילוב שלו במערכת ייצור מומלץ ליצור קשר ישיר עם המפתחים כדי לברר את תנאי השימוש החוקיים.

הרישיון המלא בעמוד המודל ↗