GPT
X

xP3all

קוד פתוח

bigscienceapache-2.02022-07-30

אוסף ענק של הוראות מובנות לרוחב 46 שפות ו־16 משימות שונות. הוא נבנה עבור מי שרוצה לאמן או לבחון מודלים רב-לשוניים על משימות מגוונות עם פרומפטים באנגלית.

  • 32,346הורדות בחודש
  • 32לייקים

מה זה

המאגר מכיל עשרות מיליוני דוגמאות בפורמט פשוט של קלט מול פלט, inputs ו־targets. הרשומות מבוססות על עשרות דאטהסטים ציבוריים מוכרים כמו SQuAD, Hotpot QA, TyDI QA, תרגומי Flores וספריות קוד, שעברו המרה לפורמט של הוראות טקסטואליות בעזרת קהילת PromptSource. הטקסטים מכסים 16 משימות, כולל שאלות ותשובות, סיכום, סנטימנט, זיהוי פרפרזות ויצירת קוד.

בשונה מגרסת xP3 הרגילה ששימשה לאימון BLOOMZ ו־mT0, הגרסה הזו כוללת גם את דאטהסטי ההערכה, למעט HumanEval. נוספו כאן משימות היקש לוגי כמו XNLI ו־ANLI, רזולוציית אזכורים עם Winogrande, והשלמת משפטים כמו HellaSwag ו־XStoryCloze, לצד נתוני תרגום נוספים מ־MultiEurlex.

מתאים ל

  • אימון הוראות רב-לשוני

    כוונון עדין של מודלים להתמודדות עם מגוון משימות שפה בעשרות שפות שונות במקביל.

  • מבחני ביצועים למודלים

    בדיקת יכולת הכללה של מודל שפה על משימות היקש, מענה לשאלות וקוד.

  • אימון מודלים לכתיבת קוד

    שימוש במדגם המשימות הייעודי של סינתזת קוד מתוך APPS ו־MBPP.

איפה זה נופל

הבעיה המרכזית עבור פיתוח מקומי היא היעדר עברית, השפה פשוט לא קיימת ב־46 השפות שבמאגר. בנוסף, חלוקת הנתונים מוטה בכבדות. אנגלית תופסת כארבעים אחוז מהנפח, בעוד שפות רבות כוללות רק משפטי תרגום בודדים מתוך Flores. כל הפרומפטים וההוראות עצמן כתובים באנגלית בלבד, גם כשהטקסט המנותח הוא בשפה אחרת. מאחר שהנתונים נאספו מדאטהסטים ישנים עוד מ־2022 ומטה, הם כוללים את כל ההטיות המקוריות של סריקות הרשת וויקיפדיה.

שאלות
נפוצות

האם יש בדאטהסט הזה נתונים בעברית?

לא. הרשימה כוללת 46 שפות כמו ערבית, צרפתית, ספרדית, קוד ושפות אפריקאיות והודיות, אך עברית אינה נכללת באף אחד מהמקטעים.

מותר להשתמש בזה כדי לאמן מודל למוצר מסחרי?

כן. הדאטהסט משוחרר תחת רישיון Apache 2.0, שמאפשר שימוש מסחרי מלא באימון מודלים ובבניית יישומים. עליכם רק לתת קרדיט ולצרף את עותק הרישיון בהתאם לתנאיו.

מה ההבדל בין xP3all לבין xP3 הרגיל?

גרסת xP3 הרגילה נועדה רק לאימון וכוללת 13 משימות. גרסת xP3all מוסיפה עוד שלוש משימות ואת כל דאטהסטי ההערכה והבנצ'מרק, למעט HumanEval, כדי לאפשר כיסוי מלא יותר.

כמה שטח אחסון צריך כדי להוריד את הכל?

הטבלה הרשמית מציגה נפח כולל של קרוב למאה גיגה-בייט עבור כל קובצי ה־JSONL. אם מעניינת אתכם שפה ספציפית, תוכלו להוריד רק את הקבצים שלה ולחסוך את רוב הנפח.

איך טוענים

טוענים את הנתונים ישירות מספרית datasets לפי שפה, או מורידים קובצי JSONL ספציפיים מתוך 17,076 הקבצים במאגר. אין צורך בבקשת גישה, המאגר פתוח לחלוטין. קחו בחשבון שמדובר בנפח עצום שמגיע לכמעט 100 גיגה-בייט של טקסט דחוס, כך שמומלץ לעבוד עם מנגנון streaming או להוריד רק את קובצי השפה הרלוונטיים לפרויקט שלכם, כמו merged_ar.jsonl או קובצי האנגלית.

from datasets import load_dataset

ds = load_dataset("bigscience/xP3all")

הרישיון

המאגר מופץ ברישיון Apache 2.0. הרישיון מתיר שימוש מסחרי חופשי, שינוי והפצה, כולל אימון של מודלים מסחריים סגורים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי, ללא דרישה לפתוח את הקוד שלכם או לשתף את המודל המאומן באותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗