GPT
X

xP3mt

קוד פתוח

bigscienceapache-2.02022-09-28

אוסף משימות מגוון לאימון מודלים רב-לשוניים בהוראות, שכולל פרומפטים שתורגמו במכונה מעברית לשפות נוספות. מתאים למי שרוצה ביצועי zero-shot במודל מבלי להגביל את ההנחיות לאנגלית בלבד.

  • 17,336הורדות בחודש
  • 26לייקים

מה זה

המאגר מכיל 80,100,816 דוגמאות ב־46 שפות שונות ומכסה 13 משימות אימון שונות. המשימות כוללות מענה על שאלות מסוגים שונים, תרגום, תמצות, סיווג נושאים, זיהוי כוונות וניתוח סנטימנט, לצד משימות קוד כמו יצירת תוכנה מתוך טקסט. כל רשומה במאגר מורכבת משני שדות טקסט בלבד: שדה inputs שמכיל את ההוראה והקלט, ושדה targets שמכיל את הפלט שהמודל אמור לייצר.

הנתונים נאספו מעשרות מאגרים קיימים ומוכרים, ביניהם Flores-200, SQuAD v2, CNN Daily Mail, PAWS-X ומאגרי קוד כמו MBPP ו־APPS. ההבדל המרכזי בגרסה הזו לעומת מאגר xP3 הרגיל הוא שפרומפטים שנכתבו במקור באנגלית עבור מאגרים חד-לשוניים עברו כאן תרגום מכונה ל־20 שפות, במטרה לאפשר אימון ישיר בהוראות בשפת היעד.

מתאים ל

  • אימון מודלים רב-לשוניים

    אימון והתאמת מודלים כמו BLOOMZ או mT0 למענה על הוראות במגוון רחב של שפות.

  • אימון מודלי קוד והסבר

    כוונון מודלים למשימות סינתזת תוכנה, יצירת קוד מטקסט והבנת docstrings.

  • הערכת ביצועי Zero-Shot

    בדיקת יכולת המודל להבין פקודות בשפות שאינן אנגלית ללא צורך בדוגמאות מקדימות.

איפה זה נופל

ההוראות ב־20 השפות המרכזיות תורגמו בתרגום מכונה ולא בידי אדם, ולכן הן כוללות ניסוחים לא טבעיים ושגיאות תרגום אופייניות. בנוסף, חלוקת השפות לא מאוזנת בעליל: אנגלית תופסת כ־40% מנפח הנתונים עם מעל 32 מיליון דוגמאות, בעוד שפות רבות כוללות רק משפטי תרגום קצרים מ־Flores ללא פרומפטים מתורגמים כלל. עברית אינה נכללת במאגר הזה, כך שהוא לא יעזור ישירות למי שמפתח מוצר שמיועד לשוק המקומי.

שאלות
נפוצות

האם הדאטהסט מתאים לעבודה בעברית?

לא. עברית אינה מופיעה ברשימת 46 השפות של המאגר, ולכן הוא אינו מספק נתוני אימון או פרומפטים בעברית.

מה ההבדל בין xP3mt לבין xP3 הרגיל?

במאגר xP3 הרגיל ההוראות והפרומפטים מנוסחים באנגלית בלבד עבור רוב המשימות. בגרסת xP3mt הפרומפטים תורגמו במכונה לעוד 20 שפות כדי לאמן מודלים על הנחיות שאינן באנגלית.

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המוצהר של המאגר הוא apache-2.0, שמאפשר שימוש מסחרי. יחד עם זאת, כיוון שהנתונים נאספו מעשרות מקורות חיצוניים שונים, כדאי לוודא שהרישיונות של מערכי הנתונים הספציפיים בפנים לא מגבילים את השימוש שלכם.

כמה שטח דיסק נדרש כדי להוריד את כל המאגר?

סך כל הקבצים במאגר שוקל כ־97 גיגה-בייט בפורמט JSONL. אם אתם צריכים רק שפות מסוימות, מומלץ להוריד ישירות רק את קובצי השפה הרלוונטיים ולא את כל 16,971 הקבצים.

איך טוענים

הנתונים מחולקים ל־16,971 קבצים בפורמט JSONL לפי שפות ומשימות, כגון קובצי merged פר שפה. נפח הנתונים הכולל מגיע לכ־97 גיגה-בייט, כך שצריך להיערך עם שטח אחסון ורוחב פס מתאימים. אין צורך בבקשת אישור גישה מיוחדת, והמאגר פתוח להורדה ישירה דרך ספריית datasets או בגישה ישירה לקבצים. כשמעבדים את הנתונים, יש לגשת לשדות inputs ו־targets בלבד.

from datasets import load_dataset

ds = load_dataset("bigscience/xP3mt")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0, שמתיר שימוש מסחרי, שינוי והפצה ללא תשלום תמלוגים, ומחייב מתן קרדיט והצהרת שינויים. עם זאת, המאגר מורכב מעשרות מקורות מידע שונים שלכל אחד מהם עשויים להיות תנאי שימוש מקוריים משלו, נקודה שמפתחים צריכים לבדוק אם מאמנים מודל שמיועד להפצה מסחרית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗