GPT
P

P3

קוד פתוח

bigscienceapache-2.02022-03-02

אוסף ענק של משימות NLP מגוונות שהומרו להנחיות טקסטואליות ישירות. מתאים למי שרוצה לאמן מודלים להבנת הוראות באנגלית בלי להמציא תבניות לבד.

  • 120,904הורדות בחודש
  • 235לייקים

מה זה

המאגר מאגד משימות עיבוד שפה טבעית מוכרות כמו סיווג טקסט, ניתוח סנטימנט, מענה על שאלות והסקה לוגית, מתוך מקורות כמו AG News, Amazon Polarity, Adversarial QA ו־ANLI. כל דוגמה מגיעה בפורמט אחיד שכולל את הטקסט המקורי כקלט ואת התשובה הצפויה כמטרה.

בפנים יש מעל 2,000 קונפיגורציות שונות, כשכל משימה מקורית מנוסחת מחדש בעזרת מספר תבניות שונות של הנחיות. חלק מהתבניות מציגות שאלות ישירות, חלק מוסיפות אפשרויות בחירה, וחלק מנוסחות בצורה חופשית כדי לייצר גיוון לשוני רחב. הנתונים תויגו על ידי מומחים והמוני עובדים ברשת.

מתאים ל

  • אימון מודלים לפקודות

    כיוונון עדין של מודלי שפה על הוראות מובנות כדי לשפר תגובה לפרומפטים באנגלית.

  • בדיקת הכללה באפס דוגמאות

    הערכת ביצועי מודל על ניסוחים שונים של משימות סיווג ומענה על שאלות שלא ראה.

  • אימון משימות בחירה מרובה

    שימוש ברשומות הכוללות רשימות אפשרויות לפתרון בעיות היגיון ומבחנים אמריקאיים.

איפה זה נופל

המאגר מוגבל לשפה האנגלית בלבד, ואין בו שום תמיכה בעברית. הנתונים פורסמו במרץ 2022 ומבוססים על דאטהסטים קיימים, חלקם ותיקים, כך שהם כוללים את אותן הטיות היסטוריות, פערי ידע וסגנון כתיבה מיושן שנמצאים במקור. בנוסף, חלוקת המשימות מרובה מאוד ויש חזרתיות עצומה של אותם טקסטים תחת ניסוחי פרומפטים שונים, מה שעלול לייצר התאמת יתר אם לא מסננים תצורות בקפידה.

שאלות
נפוצות

האם יש במאגר נתונים בעברית?

לא. המאגר מוגדר כשפת אנגלית בלבד ואינו כולל טקסטים או משימות בעברית.

האם מותר להשתמש בו למוצר מסחרי?

רישיון המאגר הכולל הוא Apache 2.0 המתיר שימוש מסחרי, אך הוא מאגד מאגרי מקור רבים. כדאי לבדוק את הרישיון המקורי של תת הדאטהסט הספציפי שאתם שולפים.

למה יש כל כך הרבה קבצים וקונפיגורציות?

כל משימת מקור עברה המרה למספר רב של תבניות פרומפט שונות. הקבצים מופרדים כדי שתוכלו לטעון רק את הניסוחים והמשימות שמעניינים אתכם.

האם כדאי להוריד את כל הדאטהסט למחשב?

ממש לא. הוא מכיל מעל 100 מיליון שורות ואלפי קבצים. עדיף להגדיר קונפיגורציה בודדת בכל פעם או להשתמש בטעינה מוזרמת.

איך טוענים

טוענים תת קבוצה ספציפית בעזרת ספריית datasets לפי שם הקונפיגורציה הרצויה, למשל ag_news_classify, בקובצי parquet מוכנים. אל תנסו למשוך הכל בבת אחת כי המאגר כולו מכיל בין 100 מיליון למיליארד רשומות ויחנוק לכם את האחסון. השדות המרכזיים לעבודה הם inputs_pretokenized לקלט הטקסטואלי ו־targets_pretokenized לתשובה. קיימים גם שדות עם טוקניזציה מובנית מסוג int32 ורשימות בחירה במידת הצורך.

from datasets import load_dataset

ds = load_dataset("bigscience/P3")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי והפצה, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקורי. עם זאת, הדאטהסט מורכב מחיבור של עשרות מאגרי מקור עצמאיים, ולכן לפני אימון מודל מסחרי חובה לוודא שרישיונות המקור של כל תת קבוצה שבה אתם משתמשים אכן מתירים זאת בפועל.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗