GPT
A

aya_collection_language_split

קוד פתוח

CohereLabsapache-2.02024-03-12

אוסף הוראות רב לשוני עצום שמחולק לפי שפות ומתאים לאימון מודלים מונחי משימה. מי שבונה מודל לשפה ספציפית מקבל כאן פיצול נקי בלי צורך לסנן שפות אחרות.

  • 17,553הורדות בחודש
  • 121לייקים

מה זה

המאגר מכיל דוגמאות של קלט ופלט בפורמט של משימות והוראות, לצד מטא דאטה מפורט שכולל את מזהה הדוגמה, סוג המשימה, מזהה התבנית, שפת הטקסט ומערכת הכתב שלה. כל רשומה כוללת גם את שם תת המאגר שממנו היא נלקחה במקור, מה שמאפשר לעקוב אחרי המקורות השונים שהרכיבו את האוסף הכללי.

המבנה הפנימי מחולק לתצורות לפי שפה, כשכל שפה מקבלת קונפיגורציה משלה שמחולקת לסטים של אימון, ולידציה ובדיקה. אפשר לראות שהשפות נשענות על תבניות קבועות שחזרו על עצמן, כאשר חלק מהשפות קיבלו מיליוני דוגמאות ואחרות קיבלו מדגמים מצומצמים בהרבה, בהתאם למקורות שהיו זמינים למפרסמים.

הכרטיס מציג את השדות inputs ו־targets כבסיס לכל אימון, ומקשר אותם למזהה תבנית ספציפי. החלוקה לשפות נותנת גישה ישירה לכל תצורה בנפרד, כך שאין צורך להוריד את כל המאגר כשרוצים להתמקד בשפה אחת.

מתאים ל

  • אימון הוראות לשפה בודדת

    שליפת תצורה ייעודית לשפה מסוימת ואימון מודל מקומי על קלט ופלט מובנים.

  • הערכת ביצועים רב לשונית

    שימוש בסט המבחן של שפות שונות כדי לבדוק יכולת הכללה על משימות זהות.

  • סינון משימות לפי תבנית

    חיתוך הנתונים לפי שדה סוג המשימה ובניית דאטהסט ממוקד למטרה אחת בלבד.

איפה זה נופל

הפער בין השפות קיצוני, שפות מסוימות מגיעות עם מיליוני רשומות ואחרות עם מאות בודדות, כמו במבה או פונו. חלק עצום מהדאטה נוצר באמצעות שכפול תבניות ותרגומים, מה שמייצר טעויות ניסוח, תרגום מכונה צורם ומשפטים לא טבעיים. עברית מופיעה ברשימת השפות של המאגר הראשי, אבל חובה לבדוק ידנית את איכות הפלט לפני שרצים לאמן, כי תבניות סינתטיות נוטות להישבר בעברית.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא אפאצ'י 2.0, שמתיר שימוש מסחרי מלא כולל אימון מודלים פנימיים. נדרש רק להשאיר את הצהרת זכויות היוצרים והרישיון המקורי במסמכי הפרויקט.

האם יש במאגר נתונים בעברית?

הקוד heb מופיע ברשימת השפות של המאגר, כלומר קיימת תצורה לעברית. עם זאת, מכיוון שחלק גדול מהטקסטים נוצר מתבניות מתורגמות, מומלץ לבדוק את איכות התחביר לפני האימון.

כמה המאגר שוקל בעת ההורדה?

המשקל תלוי בשפה שבוחרים להוריד, שכן המאגר מחולק לתצורות עצמאיות. שפות גדולות כמו אנגלית דורשות הורדה של מעל שבעה גיגה בייט, בעוד שפות קטנות שוקלות עשרות קילו בייטים בודדים.

מה ההבדל בין מאגר זה לגרסה הכללית של איה?

בגרסה הזו הנתונים פוצלו מראש לקבצים נפרדים לפי שפות, במקום קובץ ענק ומעורב. זה חוסך הורדה של עשרות גיגה בייטים כשמעוניינים לחקור או לאמן על שפה אחת בלבד.

איך טוענים

טוענים תצורה בודדת דרך ספריית הדאטהסטס על ידי ציון שם השפה הרצויה בקריאה הרגילה. הנתונים מגיעים בקובצי פרקט שמחולקים לפי ספליטים של אימון, ולידציה ומבחן. המאגר ציבורי לגמרי ופתוח להורדה בלי דרישה לאישור גישה מראש. השדות הקריטיים לתהליך האימון הם קלט ופלט, אבל מומלץ לסנן לפי סוג המשימה כדי לשמור על איכות אחידה של הנתונים.

from datasets import load_dataset

ds = load_dataset("CohereLabs/aya_collection_language_split")

הרישיון

הפרויקט מופץ תחת רישיון אפאצ'י 2.0 המאפשר שימוש מסחרי, שינוי והפצה של הנתונים. הדרישה העיקרית היא מתן קרדיט ושמירה על הודעת הרישיון המקורית. הרישיון מתירני מאוד ואינו מחייב שיתוף באותו רישיון, כך שמודלים שאומנו עליו יכולים להישאר סגורים ולשמש מוצרים מסחריים בלי לחשוף את הקוד או המשקולות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗