GPT
A

aya_collection

קוד פתוח

CohereLabsapache-2.02024-01-31

אוסף ענק של הוראות מובנות במאות מיליוני דוגמאות ובלמעלה ממאה שפות. הוא נבנה עבור מי שרוצה לאמן מודלים רב-לשוניים לביצוע משימות טקסט, תרגום וסיווג בהיקף נרחב.

  • 26,854הורדות בחודש
  • 238לייקים

מה זה

המאגר כולל סדרה רחבה של קונפיגורציות שמבוססות על דאטהסטים קיימים ממקורות שונים, לצד תת-מאגר ייעודי שנקרא aya_dataset. כל רשומה במאגר מורכבת מטקסט קלט, טקסט פלט מצופה, מזהה ייחודי, סוג המשימה, מזהה תבנית, שפת הטקסט, הכתב שבו הוא נכתב, וחלוקת הנתונים. המבנה האחיד הזה מאפשר לגשת למגוון גדול של מקורות בלי להתאים את הקוד לכל מקור בנפרד.

המקורות מגוונים מאוד ומכסים משימות כמו שאלות ותשובות, ניתוח סנטימנט, פרפראזה, חדשות, וסיפורים בשפות רבות. החלקים השונים מופרדים לפי שפות ומשימות, כמו סנטימנט בשפות אפריקאיות, הנחיות ביפנית ובפרסית, בדיחות בטלוגו, ותיקון דקדוק באוקראינית. הנתונים אורגנו באמצעות תבניות מוגדרות שהמירו מאגרי מידע קיימים לפורמט של קלט ופלט, מה שמייצר נפח עצום של דוגמאות אבל תלוי באיכות המקורות המקוריים שמהם המידע הגיע.

מתאים ל

  • אימון הוראות רב-לשוני

    כוונון מודלי שפה לביצוע פקודות ביותר ממאה שפות מתוך מגוון תבניות.

  • הערכת ביצועי משימות

    בדיקת מודלים קיימים על חלוקות מבחן של סיווג, תמצות ותרגום.

  • אימון מודל סנטימנט מקומי

    שימוש בתת-מאגרים ייעודיים כמו ניתוח רגש כדי לבנות מסווגים ממוקדים.

איפה זה נופל

הבעיה המרכזית כאן היא אי-איזון קיצוני בין השפות והמשימות. חלק מהקונפיגורציות כוללות מיליוני דוגמאות בעוד שאחרות מכילות מאות בודדות בלבד, כך שאימון עיוור יטה את המודל לטובת שפות ספציפיות כמו יפנית או תאי. בנוסף, חלק גדול מהחומר נשען על תבניות סינתטיות שהולבשו על דאטהסטים קיימים, מה שעלול לייצר ניסוחים רובוטיים או לחזור על אותם מבנים. למרות שהרשימה כוללת עברית, הכרטיס לא מפרט תת-מאגר ייעודי עבורה, ולכן חובה לדגום ולבדוק את האיכות שלה לפני שרצים לאמן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון הוא apache-2.0, שמאפשר שימוש מסחרי מלא כולל אימון מודלים פנימיים או מסחריים. תצטרכו רק לשמור על תנאי הייחוס של היוצרים.

האם הדאטהסט כולל נתונים בעברית?

עברית מופיעה ברשימת השפות של המאגר תחת הקוד heb. עם זאת, אין בפירוט התצורות קובץ ייעודי נפרד לעברית כמו בשפות אחרות, ולכן צריך לסנן את השפה מתוך הקונפיגורציות הרחבות.

כמה מקום צריך בשביל להוריד אותו?

המאגר כולו מכיל בין 100 מיליון למיליארד רשומות ומחולק לכמעט 300 קבצים. הורדה של כלל התצורות דורשת עשרות עד מאות ג'יגה-בייט, לכן מומלץ לעבוד עם קונפיגורציה בודדת בכל פעם.

איך הנתונים נאספו ונבנו בפועל?

חלק גדול מהמאגר מורכב מדאטהסטים מוכרים קיימים שחוברו לתבניות הנחיה אחידות. לצדם קיים תת-מאגר מרכזי בשם aya_dataset שכולל דוגמאות אימון ייעודיות.

איך טוענים

אתם טוענים את הנתונים ישירות דרך ספריית datasets באמצעות ציון שם המאגר והקונפיגורציה הרצויה. אין צורך באישור גישה מיוחד, המאגר פתוח לציבור בפורמט Parquet שמחולק למאות קבצים. בגלל הגודל העצום שמגיע למאות מיליוני רשומות, לא מומלץ למשוך את הכל בבת אחת. עדיף להגדיר תת-מאגר ספציפי כמו aya_dataset או אחד מקובצי התבניות לפי שפת היעד, ולעבוד רק עם שדות ה־inputs וה־targets שדרושים לאימון.

from datasets import load_dataset

ds = load_dataset("CohereLabs/aya_collection")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי, והפצה של הנתונים ושל מודלים שאומנו עליהם, בלי דרישה לשתף את הקוד או את המשקלים באותו רישיון. החובה העיקרית היא לכלול עותק של הרישיון המקורי ולתת קרדיט ליוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗