GPT
X

xP3

קוד פתוח

bigscienceapache-2.02022-10-10

אוסף עצום של פרומפטים בפורמט הוראות שמכסה 46 שפות וקוד, במקור עבור אימון BLOOMZ. הוא מתאים למי שרוצה ללמד מודל לעקוב אחרי פקודות ביותר משפה אחת.

  • 54,685הורדות בחודש
  • 113לייקים

מה זה

המאגר מאחד עשרות דאטהסטים קיימים של עיבוד שפה טבעית לתוך מבנה אחיד שמיועד למודלי שפה. כל רשומה כוללת שני שדות טקסט בלבד: שדה קלט שמכיל את המשימה וההוראה באנגלית, ושדה פלט שמכיל את התשובה המצופה. המשימות מחולקות ל־13 קטגוריות שונות לאימון, בהן שאלות ותשובות, סיכום טקסט, ניתוח רגש, סיווג נושאים, זיהוי פרפרזות ויצירת קוד.

המקורות מגוונים מאוד ומגיעים מדאטהסטים מוכרים כמו SQuAD, CNN Daily Mail, Flores-200, ו־Tatoeba, לצד מאגרי קוד כמו CodeContests ו־MBPP. איסוף הנתונים התבסס על הפיכת משימות ה־NLP המקוריות לפרומפטים בעזרת תבניות שפותחו במיזם promptsource. המאגר מכיל 78,883,588 דוגמאות שנאספו ללא תרגום של ההוראות עצמן, אלא רק של הטקסט שנבדק, כאשר ההוראה נשארת באנגלית.

מתאים ל

  • אימון הוראות רב לשוני

    כוונון מודלים למעקב אחר הוראות ב־46 שפות שונות במקביל.

  • הוראת משימות קוד

    אימון מודלי תכנות להמרת בעיות טקסט לקוד על בסיס מיליוני דוגמאות.

  • בדיקת הכללה חוצת שפות

    בחינת יכולת המודל לבצע משימות בשפות שונות כשההנחיה באנגלית.

איפה זה נופל

הבעיה המרכזית היא חוסר איזון חריף. אנגלית לבדה תופסת כמעט 40% מהדאטהסט עם מעל 31 מיליון דוגמאות, בעוד שפות רבות כוללות רק תרגומי משפטים בודדים ממאגר Flores ומגיעות לכמה עשרות מגה-בייט בלבד. בנוסף, כל ההנחיות נכתבו באנגלית בלבד, כך שהמודל לומד להבין פקודה אנגלית על טקסט זר ולא פקודה בשפת היעד. עברית לא קיימת כאן בכלל, כך שלפיתוח מקומי בעברית המאגר חסר תועלת ישירה.

שאלות
נפוצות

האם הדאטהסט כולל עברית?

לא. המאגר כולל 46 שפות, בהן ערבית, ספרדית, צרפתית, הינדית ומגוון שפות אסייתיות ואפריקאיות, אך עברית אינה נכללת ברשימה.

האם מותר להשתמש בו למוצר מסחרי?

כן, הרישיון המוגדר הוא Apache 2.0 שמאפשר שימוש מסחרי מלא. מותר לאמן עליו מודלים מסחריים ולסגור את הקוד, כל עוד מקפידים על מתן קרדיט כנדרש ברישיון.

מה ההבדל בינו לבין גרסת xP3mt?

בגרסה הזו ההנחיות מנוסחות באנגלית בלבד גם כאשר הטקסט עצמו הוא בשפה אחרת. בגרסת xP3mt תרגמו מכונה את הפרומפטים עצמם ל־20 שפות שונות.

כמה מקום צריך בשביל להוריד את הכל?

הקבצים המאוחדים שוקלים יחד כ־95 גיגה-בייט. אם אתם צריכים רק שפה מסוימת, ניתן להוריד קובץ בודד ששוקל בין מאות מגה-בייט לג'יגות בודדות, למעט אנגלית ששוקלת מעל 37 גיגה-בייט.

איך טוענים

המאגר מפוצל ל־16,831 קבצים בפורמט JSONL, כשהגישה אליו חופשית לחלוטין וללא צורך באישור מיוחד. לכל שפה יש קובץ מאוחד משלה, כמו merged_en.jsonl, לצד קבצים נפרדים לפי משימות ומקורות. המשקל הכולל של הטקסט מגיע לכ־95 ג'יגה-בייט, כך שלא מומלץ למשוך הכל בבת אחת לזיכרון אלא לקרוא בסטרימינג או להוריד רק את השפות הדרושות. בכל דוגמה יש לשים לב רק לשני מפתחות: inputs ו־targets.

from datasets import load_dataset

ds = load_dataset("bigscience/xP3")

הרישיון

המאגר פורסם ברישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של המידע ואימון מודלים לכל מטרה, ללא חובה לשתף את התוצרים באותו רישיון. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי. יחד עם זאת, מכיוון שמדובר באוסף של עשרות דאטהסטים מקוריים, כדאי לזכור שחלק ממאגרי המקור עשויים להחזיק תנאי שימוש פרטניים משלהם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗