GPT
B

bert-base-spanish-wwm-uncased

קוד פתוח

dccuchileרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

גרסת BERT ייעודית לספרדית בגודל בסיסי, שמטפלת במילים שלמות במקום בחלקי מילים. פתרון ממוקד למי שצריך עיבוד טקסט בספרדית בלי להסתמך על מודל רב-לשוני כללי.

  • 512טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 426,425הורדות בחודש
  • 76לייקים

מה זה

מדובר במודל שפותח באוניברסיטת צ'ילה, מוכר בכינוי BETO, ואומן מראש על קורפוס ספרדי גדול במשך 2 מיליון צעדים עם מילון של כ־31 אלף תת-מילים. הוא משתמש בטכניקת מיסוך מילים שלמות, כך שבמשימת מילוי המסכות הוא לומד קשרים סמנטיים שלמים ולא רק משלים הברות בודדות.

במבחני ביצועים בספרדית הוא מציג יתרון ברור על פני מודלים רב-לשוניים כלליים כמו Multilingual BERT, במיוחד בסיווג מסמכים עם ציון של 96.12 במדד MLDoc, ניתוח חלקי דיבר עם 98.44, והסקה לשונית עם 80.15 ב־XNLI. הוא עוקף את המתחרים הרב-לשוניים ברוב המשימות, למעט זיהוי פרפרזות שבו המודל הרב-לשוני הוביל מעט.

מתאים ל

  • סיווג מסמכים בספרדית

    משיג ציון 96.12 במדד MLDoc ומתאים למיון טקסטים ארוכים ונקיים מאותיות גדולות.

  • ניתוח חלקי דיבר

    מגיע לדיוק של 98.44 במשימות תחביר ודקדוק בספרדית.

  • הסקה לשונית ומחקר

    עוקף מודלים רב-לשוניים במבחן XNLI עם 80.15 נקודות.

איפה זה נופל

הגרסה הזו מתעלמת מגודל אותיות, והמחיר ניכר מיד בתוצאות: במשימת זיהוי ישויות שמיות הוא מגיע ל־82.67 בלבד, בעוד הגרסה ששומרת על אותיות גדולות מגיעה ל־88.43. בנוסף, חלון ההקשר מוגבל ל־512 טוקנים והוא תומך רק בספרדית. אין כאן יכולות שיחה, מענה לשאלות מורכבות או יצירת טקסט חופשי, אלא רק השלמת מסכות והפקת ייצוגים וקטוריים.

שאלות
נפוצות

האם עדיף לבחור בגרסה הזו או בגרסת cased?

אם המשימה שלכם כוללת זיהוי שמות, מותגים או מקומות, עדיף להשתמש בגרסת ה־cased שהשיגה 88.43 לעומת 82.67 בלבד בגרסה זו. לטקסטים כלליים, סיווג נושאים או ניתוח דקדוקי שבהם האותיות הגדולות אינן קריטיות, הגרסה הנוכחית מתאימה לחלוטין.

האם אפשר להשתמש בו לטקסטים בעברית או באנגלית?

לא. המודל אומן על קורפוס בספרדית בלבד והמילון שלו נבנה לשפה זו. לטקסטים מעורבים או בעברית צריך מודל רב-לשוני ייעודי או מודל שאומן על עברית.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers ב־PyTorch או ב־TensorFlow. המשקל הכולל של הקבצים עומד על 1.3 גיגה-בייט, כך שהוא רץ בקלות על מעבד רגיל של שרת פיתוח או מחשב נייד, ואינו דורש חומרה מיוחדת או כרטיס גרפי כבד לצורך הרצה והסקה.

גרסה זו היא uncased, כלומר היא מתעלמת מאותיות גדולות וקטנות. אם אתם צריכים לאמן אותו על דאטה משלכם תצטרכו כרטיס גרפי בסיסי, אבל לצורך שאילתות אין שום סיבה לשלם על API חיצוני כשקל מאוד להחזיק אותו עצמאית במערכת.

from transformers import pipeline

pipe = pipeline("fill-mask", model="dccuchile/bert-base-spanish-wwm-uncased")
print(pipe("שלום"))

הרישיון

הרישיון הרשמי מוגדר כלא דווח. המפתחים מציינים כי כוונתם הייתה להפיץ אותו תחת CC BY 4.0, אך מבהירים שאינם בטוחים אם כל מאגרי המידע ששימשו לאימון מתאימים לרישיון כזה, במיוחד לשימוש מסחרי. שילוב שלו במוצר מסחרי דורש בדיקה משפטית עצמאית של מקורות המידע.

הרישיון המלא בעמוד המודל ↗