GPT
M

mt5-small

קוד פתוח

googleapache-2.02022-03-02

  • transformers
  • pytorch
  • tf
  • jax
  • onnx

גרסה רב לשונית של T5 שגוגל אימנה על 101 שפות. מתאימה למי שבונה משימת טקסט מותאמת אישית וצריך תמיכה מובנית במגוון רחב של שפות כולל עברית.

  • 7.1 GBמשקל הקבצים
  • 243,160הורדות בחודש
  • 193לייקים

מה זה

גוגל פיתחה את המודל הזה כעיבוד רב לשוני ישיר לארכיטקטורת text-to-text המוכרת שלהם, במטרה לטפל במשימות שפה מעבר לאנגלית. הוא אומן על קורפוס mC4 הענקי, שכולל טקסטים שנסרקו מהרשת ב־101 שפות שונות, וביניהן עברית, ערבית, רוסית ושפות אירופיות ואסיאתיות רבות. כל משימה מוגדרת אצלו כקלט טקסטואלי שמייצר פלט טקסטואלי, מה שמקנה גמישות ארכיטקטונית לעבודה על משימות מגוונות.

המשקל של הקבצים עומד על 7.1 גיגה בייט המחולקים לעשרים קבצים, והוא מיועד להרצה בספריית transformers באמצעות המחלקה MT5ForConditionalGeneration. מדובר בגרסת הבסיס הקטנה בסדרה, מה שמספק נקודת מוצא קלה יחסית לעיבוד שפות בלי משאבי ענק, אך יש לקחת בחשבון את המבנה שלו שמיועד כולו להתאמה ייעודית מראש.

מתאים ל

  • בסיס לכוונון בעברית

    הוא כולל עברית מאימון ה־mC4 ומהווה נקודת התחלה נוחה לאימון משימות מקומיות.

  • תרגום בין שפות נדירות

    האימון על 101 שפות מאפשר לכוונן אותו לתרגום מותאם בצמדי שפות פחות נפוצים.

  • סיווג טקסט רב לשוני

    ארכיטקטורת text-to-text מתאימה למיפוי קלטים בכל שפה נתמכת לקטגוריות טקסט.

איפה זה נופל

היוצרים מבהירים במפורש שהמודל עבר אימון מקדים בלבד על mC4, ללא שום שלב של supervised training. זה אומר שבמצבו הנוכחי הוא אינו שמיש מהקופסה לאף משימה ספציפית כמו תרגום, מענה לשאלות או סיכום. אם תריצו אותו כפי שהוא תקבלו פלטים חסרי היגיון. אתם חייבים לבצע fine-tuning מלא על דאטה מתויג לפני שהוא יוכל להשתלב בקוד פעיל.

שאלות
נפוצות

האם אפשר להשתמש במודל מיד לאחר ההורדה?

לא. גוגל מציינת במפורש שהמודל עבר אימון מקדים כללי בלבד. ללא fine-tuning על משימה מוגדרת מראש, הוא לא מסוגל לענות על שאלות או לבצע פעולות שימושיות.

האם המודל תומך בעברית בצורה מובנית?

כן, עברית היא אחת מ־101 השפות שנכללו בקורפוס mC4 עליו הוא אומן. עם זאת, איכות התוצאות הסופיות תלויה לחלוטין בדאטה שתספקו לו בשלב האימון הנוסף.

איך מריצים

את המשקלים מושכים ישירות דרך transformers של Hugging Face לתוך סביבת פייתון. גודל הקבצים של 7.1 גיגה בייט אומר שתצטרכו כרטיס מסך עם זיכרון סביר של לפחות שמונה עד שנים עשר גיגה כדי לאמן או להריץ אותו בנוחות, אם כי אפשר להסתדר גם על מעבד רגיל במחיר של מהירות.

אם אתם לא מתכננים לאמן מודל משלכם על נתונים פנימיים, אין טעם להריץ אותו מקומית. עבור משימות גנריות קיימות, מודלים מוכנים או קריאות API לשירותים שמציעים מודל מאומן יחסכו את כל תהליך הכוונון.

from transformers import pipeline

pipe = pipeline("text-generation", model="google/mt5-small")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לחלוטין, כולל שימוש מסחרי ושינוי של הקוד והמשקלים. מותר להטמיע אותו במוצרים מסחריים סגורים בלי לשחרר את הקוד שלכם, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗