GPT
A

aya_dataset

קוד פתוח

CohereLabsapache-2.02024-01-31

מעל 204 אלף צמדי הוראה ותשובה שנכתבו או נערכו בידי בני אדם בשישים וחמש שפות. הוא נותן מענה נדיר לכוונון מודלים בשפות שאינן אנגלית, כולל ערבית בכמה ניבים.

  • 23,218הורדות בחודש
  • 366לייקים

מה זה

המאגר מכיל 204,114 דוגמאות שנאספו בין מאי לדצמבר 2023 דרך פלטפורמת התנדבות של קהילת מדע פתוח. 138,844 מהן נכתבו מאפס כהוראות ותשובות מקוריות, והשאר, 65,270 רשומות, הן עריכות אנושיות לפלטים שנוצרו אוטומטית מדאטהסטים קיימים. כל רשומה כוללת את שדות הטקסט inputs ו־targets, שפת הטקסט והקוד שלה, סוג הכתיבה ומזהה משתמש אנונימי.

לצד ההוראות יש חלק נפרד של נתונים דמוגרפיים על 1,456 מתנדבים, הכולל גיל, מגדר, שפות וניבים. פיצול הנתונים מחלק את ההוראות ל־202,364 דוגמאות אימון בכל השפות, וסט מבחן של 1,750 דוגמאות שמכסה שבע שפות בלבד, ביניהן ערבית ספרותית, אנגלית וסינית.

מתאים ל

  • כוונון מודלים רב-לשוניים

    אימון מודלי שפה על משימות מילוי הוראות בשפות עם מעט משאבים, כולל ערבית.

  • הערכת ביצועים השוואתית

    בדיקת יכולת המודל לענות להוראות אנושיות בשבע השפות שנכללות בסט המבחן.

  • מחקר הטיות דמוגרפיות

    הצלבת תשובות המודל עם גיל ומגדר הכותבים באמצעות קובץ הנתונים הדמוגרפיים.

איפה זה נופל

עברית לא נכללת במאגר. פרויקט כזה שנשען על מתנדבים סובל מחוסר איזון קיצוני. בחלק מהשפות רוב הטקסט נכתב בידי כותבים בודדים, מה שיוצר הטיה חזקה לנקודת מבט אישית ותחומי עניין צרים כמו חדשות. בפלטפורמת האיסוף לא היו כפתורי דיווח על תוכן פוגעני או רעיל, והסינון נשען על בדיקות עמיתים מדגמיות בלבד. בנוסף אין מנגנון תיקון לשוני, ולכן יש במאגר מקרים של שיוך שפה שגוי או חריגה ממבנה ההוראה.

שאלות
נפוצות

האם יש בדאטהסט עברית?

לא. הדאטהסט כולל 65 שפות, ועברית אינה מופיעה ברשימה. אם הפרויקט שלכם מיועד לעברית בלבד, הדאטהסט הזה לא יקדם אתכם.

האם מותר להשתמש בו לאימון מודל מסחרי?

כן. הרישיון הוא Apache 2.0 והוא מתיר שימוש מסחרי מלא באימון מודלים ובבניית מערכות, כל עוד שומרים על תנאי הייחוס של הרישיון.

מה ההבדל בין המאגר הזה ל־aya_collection?

המאגר הזה מכיל אך ורק 204 אלף דוגמאות שנכתבו או נערכו בידי בני אדם. aya_collection הוא מאגר ענק של 513 מיליון דוגמאות שנוצרו ברובן מתבניות ותרגומים אוטומטיים.

האם המידע נקי מתוכן פוגעני?

היוצרים מציינים שלא הייתה מערכת ייעודית לסינון תכנים פוגעניים בפלטפורמת האיסוף. הסינון התבסס על בדיקות מדגמיות של מתנדבים, ולכן יש סיכוי שחלק מהטקסטים מכילים תוכן בעייתי.

איך טוענים

טוענים את המאגר ישירות בספריית datasets בלי צורך באישור גישה מראש. הקבצים מגיעים בפורמט parquet, כך שההורדה מהירה והנפח לא חריג. טעינת ברירת המחדל מושכת את קובצי האימון והבדיקה של ההוראות, ואם רוצים את המידע על הכותבים מוסיפים את תצורת demographics. השדות המרכזיים לעבודה הם inputs ו־targets, יחד עם language_code לסינון שפות.

from datasets import load_dataset

ds = load_dataset("CohereLabs/aya_dataset")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולשלב אותו במוצרים סגורים. מודל שאומן על הדאטהסט לא מחויב להיפתח לציבור. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בעת הפצת הנתונים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗