GPT
B

bertin-roberta-base-spanish

קוד פתוח

bertin-projectcc-by-4.02022-03-02

  • transformers
  • pytorch
  • jax
  • tensorboard
  • safetensors

רוברטה בספרדית שאומן על דגימת איכות חכמה מקורפוס הענק של mC4. מתאים למי שצריך מודל שפה מבוסס מקודד לעיבוד ספרדית בלי לשלם על עלויות הרצה של מודלי ענק.

  • 125Mפרמטרים
  • 514טוקנים בהקשר
  • 1.4 GBמשקל הקבצים
  • 2,033הורדות בחודש

מה זה

הפרויקט נבנה במקור במסגרת אירוע קהילתי כדי להביא ארכיטקטורת RoBERTa איכותית לדוברי ספרדית, שפה שלרוב קיבלה רק מודלים רב-לשוניים פחות ממוקדים. במקום לבלוע טרה-בייט שלם של טקסט גולמי מ־mC4, הצוות סינן את הדאטה באמצעות חישובי Perplexity ודגם כחמישים מיליון דוגמאות ממוקדות. המודל שמוצג כאן מייצג את הגרסה הטובה ביותר בסדרה, עם שתים עשרה שכבות ומאה עשרים וחמישה מיליון פרמטרים.

בבדיקות משימות המשך, גרסת הגאוסיאן הגיעה לדיוק של כמעט שבעים אחוז במשימת השלמת מילים מוסתרות באורך הקשר מלא. היא עוקפת את מודל mBERT הרב-לשוני במשימות זיהוי ישויות וחלק דיבור בספרדית, ומציגה ביצועי סיווג תחרותיים מאוד מול מודלים שאומנו על משאבי חישוב כבדים בהרבה.

מתאים ל

  • זיהוי ישויות בספרדית

    משיג תוצאות F1 גבוהות מול מודלים רב-לשוניים בזכות אימון ממוקד בשפה הספרדית.

  • תיוג חלקי דיבור

    מתאים לחילוץ תחבירי מדויק של טקסטים קצרים ומסמכים מוגבלים בהיקפם.

  • בסיס לכוונון סיווג

    נקודת מוצא מצוינת וקלת משקל לאימון מסווגי טקסט עסקיים בספרדית על חומרה זולה.

איפה זה נופל

זהו מודל מקודד בלבד שנועד להשלמת מילים מוסתרות ואינו מתאים ליצירת טקסט חופשי, תשובות ארוכות או שיחה. חלון ההקשר מוגבל לחמש מאות וארבעה עשר טוקנים, כך שטקסטים ארוכים במיוחד יחייבו חיתוך. בנוסף, אף שהמודל חזק בזיהוי ישויות, במבחני הסקת מסקנות טבעית הוא מפגר אחרי מודלים ייעודיים כמו BETO או BSC, והיוצרים מתריעים מפני הטיות לא רצויות שנשאבו מטקסטים מהרשת.

שאלות
נפוצות

האם המודל מבין עברית?

לא. הוא אומן מאפס על החלק הספרדי של קורפוס mC4 ומיועד אך ורק לספרדית. אין טעם להזין לו טקסטים בעברית.

האם אפשר להשתמש בו כמו צ'אט או ליצירת מאמרים?

לא, הארכיטקטורה שלו היא RobertaForMaskedLM, כלומר מקודד שמנחש מילים חסרות בתוך משפט. אם המטרה היא יצירת תוכן שוטף יש לחפש מודלי פענוח ייעודיים.

איך מריצים

במשקל של כ־1.4 גיגה-בייט, אפשר להריץ אותו ישירות דרך ספריית transformers על מעבד רגיל, אם כי כרטיס גרפי בסיסי עם 4 עד 8 גיגה זיכרון ייתן מהירות עבודה סבירה בהרבה. אין צורך בשרתים מפלצתיים או תשתיות ענן מורכבות.

ברירת המחדל בהאגינג פייס היא גרסה v2 שפורסמה באפריל 2022, והיא זו שמומלץ למשוך במקום גרסאות הבטא המוקדמות. בהתחשב בגודל הקטן ובמהירות שלו, אין שום סיבה אמיתית לשלם לספק חיצוני על API, אלא אם אתם בונים מערכת שרתים שלמה שאין בה אפילו מכונה אחת פנויה עם פייתון.

from transformers import pipeline

pipe = pipeline("fill-mask", model="bertin-project/bertin-roberta-base-spanish")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון cc-by-4.0. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו במוצר סגור, בתנאי שנותנים קרדיט ברור למחברים המקוריים ומציינים אם נעשו שינויים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗