GPT
X

xlm-roberta-base

קוד פתוח

FacebookAImit2022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • onnx

זהו מודל בסיס רב-לשוני לחיזוי מילים חסרות ולחילוץ מאפיינים מטקסט. הוא מתאים למי שבונה סיווג או תיוג טוקנים במערכות שצריכות לטפל בעשרות שפות במקביל.

  • 279Mפרמטרים
  • 514טוקנים בהקשר
  • 5.9 GBמשקל הקבצים
  • 21,379,308הורדות בחודש

מה זה

המודל אומן על 2.5 טרה-בייט של מידע מסונן מ־CommonCrawl שמכסה 100 שפות שונות, ללא תיוג אנושי. הוא פועל כארכיטקטורת RoBERTa דו-כיוונית, שמסתירה 15% מהמילים במשפט ומנסה לשחזר אותן מתוך ההקשר המלא של המשפט. בשונה ממודלים שרואים טקסט בכיוון אחד בלבד, התפיסה הדו-כיוונית מייצרת ייצוג עמוק של המשפט כולו.

עם 279 מיליון פרמטרים ו־12 שכבות, הוא משמש בעיקר כתשתית להתאמה למשימות קצה (fine-tuning). במקום להתחיל מאפס, לוקחים את המשקלים שלו ומאמנים שכבה עליונה לסיווג טקסט, מענה לשאלות או זיהוי ישויות, כשהוא מביא איתו הבנה מוקדמת של מבני משפט בשפות רבות.

מתאים ל

  • סיווג טקסט רב-לשוני

    אימון שכבת סיווג עליונה לזיהוי כוונות או ניתוח רגש במערכות שמקבלות פניות בעשרות שפות שונות במקביל.

  • תיוג ישויות בטקסט

    זיהוי שמות, מקומות ונתונים עסקיים ברמת הטוקן, בזכות הראייה הדו-כיוונית של המשפט המלא.

  • שחזור מילים חסרות

    השלמת מילים מוסתרות בתוך משפט קיים ישירות מהקופסה, ללא צורך באימון נוסף.

איפה זה נופל

זה לא מודל ליצירת טקסט חופשי. אי אפשר לבקש ממנו לכתוב תשובה, לתרגם פסקה שלמה או לנהל שיחה, ומי שמחפש משהו כזה צריך מודל אוטורגרסיבי כמו משפחת GPT. חלון ההקשר שלו מוגבל ל־514 טוקנים, כך שטקסטים ארוכים, מסמכים שלמים או קבצים מורכבים פשוט ייחתכו ולא ייכנסו לחישוב.

בנוסף, הכרטיס מציין שהמודל אומן על טקסט גולמי מהרשת ללא תיוג אנושי. זה אומר שהוא מגיע עם כל ההטיות והרעש שיש באינטרנט, ואי אפשר להסתמך עליו כמוצר מוגמר בלי אימון ייעודי ובדיקות קפדניות על סט הנתונים הספציפי שלכם.

שאלות
נפוצות

האם המודל יודע לייצר טקסט ולהמשיך פסקאות?

לא. הארכיטקטורה שלו מיועדת לחיזוי מילים מוסתרות מתוך משפט שלם ולא לכתיבה רציפה מילה אחרי מילה. בשביל משימות של יצירת תוכן, סיכום אוטומטי או שיחה, צריך לבחור מודל מסוג שונה כמו סדרת GPT.

כמה זיכרון צריך כדי להריץ אותו במחשב או בשרת?

המשקלים תופסים כ־5.9 גיגה-בייט בדיסק. להסקה רגילה מספיק כרטיס מסך בסיסי עם 8 גיגה זיכרון או אפילו מעבד סטנדרטי עם מספיק זיכרון מערכת, אבל לאימון מחדש (fine-tuning) תצטרכו חומרה חזקה יותר בהתאם לגודל האצוות שתרצו להריץ.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers בפייתון באמצעות AutoTokenizer ו־AutoModelForMaskedLM, או בצינור fill-mask מהיר. הקבצים שוקלים כ־5.9 גיגה-בייט בסך הכול, כך שכרטיס מסך בסיסי או שרת ענן צנוע יספיקו בהחלט להרצה ולעיבוד אצוות.

אם אתם רק צריכים לבדוק התכנות נקודתית, שימוש ב־API חיצוני חוסך את התקנת הסביבה והחזקת השרת. כשעוברים לאימון מודל קצה על נתונים פנימיים או שרוצים עיבוד של כמויות טקסט בלי לשלם פר קריאה, הרצה עצמית בשרת שלכם היא הדרך היחידה שמשתלמת.

from transformers import pipeline

pipe = pipeline("fill-mask", model="FacebookAI/xlm-roberta-base")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון MIT. זהו רישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי, שינוי של המשקלים, שילוב בקוד סגור והפצה בתוך מוצרים. הדרישה היחידה היא לשמור על הודעת זכויות היוצרים והרישיון המקורי בקבצי הפרויקט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗