GPT
B

bert-base-spanish-wwm-cased

קוד פתוח

dccuchileרישיון לא דווח2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • bert

זהו מודל שמיועד ספציפית לניתוח והשלמת טקסט בספרדית, עם הבחנה בין אותיות גדולות לקטנות. הוא מתאים למי שצריך דיוק גבוה בספרדית ולא רוצה להסתפק במודל רב לשוני כללי.

  • 512טוקנים בהקשר
  • 1.3 GBמשקל הקבצים
  • 64,428הורדות בחודש
  • 79לייקים

מה זה

מדובר במודל שמבוסס על ארכיטקטורת BERT Base, ואומן מראש על מאגר טקסטים גדול בספרדית בלבד תוך שימוש בשיטת מיסוך מילים שלמות. יש לו אוצר מילים ייעודי של כ־31 אלף תת־מילים שנבנה עבור השפה הספרדית, והוא אומן במשך 2 מיליון צעדים. המטרה הבסיסית שלו היא fill-mask, כלומר חיזוי מילים מוסתרות בתוך משפט, אך הוא משמש בסיס להתאמה למשימות סיווג ועיבוד שפה.

במבחני ביצועים בספרדית הוא עוקף את הגרסה הרב לשונית של BERT במרבית המשימות שנבדקו. במשימת זיהוי ישויות שמיות הוא הגיע לציון של 88.43 לעומת 87.38 של המודל הרב לשוני, ובמשימת הסקת מסקנות טקסטואלית הוא השיג 82.01 לעומת 78.50. עם זאת, בזיהוי ניסוחים מקבילים הוא דווקא פיגר מעט אחרי המודל הרב לשוני עם 89.05 לעומת 90.70.

מתאים ל

  • זיהוי ישויות בספרדית

    השמירה על אותיות גדולות נותנת לו יתרון בזיהוי שמות ומקומות, עם ציון 88.43 במבחן NER-C.

  • סיווג טקסט ומסמכים

    הוא השיג 95.60 במבחן MLDoc, ומתאים כבסיס למיון פניות לקוחות או כתבות בספרדית.

  • ניתוח תחבירי

    במשימת POS המודל מגיע לציון של 98.97, מה שהופך אותו לכלי מדויק לפירוק דקדוקי של משפטים.

איפה זה נופל

חלון ההקשר מוגבל ל־512 טוקנים, ולכן אי אפשר להזין לו מסמכים שלמים בלי לחתוך אותם מראש. בנוסף, המודל אומן על ספרדית בלבד ולא יתאים לטקסט מעורב או רב לשוני. במשימת פרפרזות הוא השיג ציון נמוך יותר ממודל רב לשוני, כך שהוא לא בהכרח הבחירה הטובה ביותר לכל שימוש בספרדית, ויש לבדוק אותו מול הנתונים שלכם.

שאלות
נפוצות

במה עדיפה גרסת cased על פני גרסת uncased?

גרסת cased מבדילה בין אותיות גדולות לקטנות. זה חיוני בספרדית עבור זיהוי שמות עצם פרטיים וראשי תיבות, ומסביר מדוע הגרסה הזו השיגה תוצאה טובה בהרבה במבחן זיהוי ישויות לעומת ה־uncased.

האם המודל יודע לייצר טקסט חופשי כמו צ'אט?

לא. הוא בנוי על ארכיטקטורת BERT ומיועד להבנת שפה והשלמת מילים חסרות בתוך הקשר קיים. אם המטרה שלכם היא יצירת טקסט חדש או ניהול שיחה, צריך מודל מסוג שונה לגמרי.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות המזהה הרשמי, עם משקלי PyTorch או TensorFlow. קובצי המודל שוקלים 1.3 גיגה בייט בלבד, כך שלא צריך שרת מפלצתי. כרטיס מסך בסיסי או מעבד סביר יספיקו לחיזוי מהיר, ולכן אין סיבה לפנות ל־API חיצוני אלא אם אתם רוצים להימנע לחלוטין מניהול תשתית.

מכיוון שזו גרסת cased, היא שומרת על אותיות גדולות וקטנות. זה קריטי למשימות כמו זיהוי שמות או מקומות בספרדית, בשונה מגרסת uncased שמתעלמת מההבדלים האלה ומתאימה למשימות סיווג כלליות יותר.

from transformers import pipeline

pipe = pipeline("fill-mask", model="dccuchile/bert-base-spanish-wwm-cased")
print(pipe("שלום"))

הרישיון

המפתחים ציינו שהכוintention המקורית שלהם היא רישיון CC BY 4.0, שמאפשר שימוש חופשי כולל שימוש מסחרי תחת מתן קרדיט. יחד עם זאת, הם מצהירים רשמית שהם לא בטוחים אם כל מאגרי המידע שעליהם אומן המודל מאפשרים שימוש מסחרי, וממליצים לבדוק זאת באופן עצמאי. בעמוד המודל לא דווח רישיון סופי, ולכן שילוב שלו במוצר מסחרי כרוך בסיכון משפטי מסוים.

הרישיון המלא בעמוד המודל ↗