GPT
A

aya_evaluation_suite

קוד פתוח

CohereLabsapache-2.02024-02-06

ערכת מבחן שנועדה לבדוק איכות יצירת טקסט של מודלים בלמעלה ממאה שפות שונות. אם אתם בונים מודל רב-לשוני ומחפשים בנצ׳מרק פתוח לשיחה חופשית, זה בדיוק המקום שממנו מתחילים.

  • 3,994הורדות בחודש
  • 55לייקים

מה זה

המאגר כולל 26,750 רשומות המורכבות מפרומפטים פתוחים בסגנון שיחה. הוא מחולק לשלושה חלקים ברורים שנאספו בין מאי לדצמבר 2023. החלק הראשון מכיל 250 דוגמאות שנכתבו במקור על ידי בני אדם בשבע שפות בלבד דרך פלטפורמת איה.

החלק השני כולל 200 פרומפטים מתוך מאגר דולי שנבחרו ידנית ותורגמו באמצעות מודל המכונה NLLB לתוך 101 שפות ו־114 דיאלקטים שונים, כולל אנגלית ועברית. החלק השלישי לוקח את אותם 200 פרומפטים מתורגמים ועובר עריכה לשונית ידנית בידי דוברי שפת אם, אך רק עבור שש שפות ספציפיות: ערבית, צרפתית, הינדי, רוסית, ספרדית וסרבית.

מתאים ל

  • בנצ'מרק השוואתי למודלים

    הרצת פרומפטים מקבילים בעשרות שפות כדי לבחון אחידות ואיכות פלט של מודל רב-לשוני מול מודלים אחרים.

  • הערכת תרגום והבנה בעברית

    בדיקת יכולת המודל להתמודד עם הנחיות שיחה בעברית מתוך 200 השאלות של תת-המאגר המתורגם.

  • אימות איכות מול עריכה אנושית

    מדידת פלט המודל מול הפרומפטים שעברו עריכת אדם בשפות כמו ערבית, צרפתית או ספרדית.

איפה זה נופל

הבעיה המרכזית כאן היא איכות התרגום. הרוב המוחלט של 101 השפות, כולל עברית, מבוסס על תרגום מכונה אוטומטי של NLLB ללא בקרת איכות אנושית. המפרסמים עצמם מודים שהתרגום המכני עלול לעוות את תוצאות ההערכה של המודל שלכם.

בנוסף, הכיסוי האנושי מצומצם מאוד. המקורות האנושיים כוללים בין 200 ל־250 דוגמאות בלבד לשפה, והחלק הערוך אנושית אינו מספק תשובות יעד בכלל. אין עדכונים מתוכננים למאגר, כך שהוא מוגבל לנתוני 2023.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. רישיון apache-2.0 מתיר שימוש מסחרי חופשי לחלוטין, כולל אימון מודלים שיוטמעו במערכות מסחריות סגורות. התנאי היחיד הוא מתן ייחוס מתאים לקוהיר ושמירה על קובץ הרישיון.

האם יש במאגר טקסטים בעברית?

כן, תת-המאגר dolly-machine-translated כולל 200 פרומפטים מתורגמים לעברית. יחד עם זאת, מדובר בתרגום מכונה אוטומטי של מודל NLLB ללא עריכה אנושית של דובר עברית.

במה הסט הזה שונה ממאגר Aya הרגיל?

מאגר איה הרגיל הוא סט ענק של מעל 204 אלף דוגמאות שנועד לאימון והתאמת הוראות. הסט הנוכחי כולל רק 26,750 רשומות ומיועד ספציפית להערכה ובדיקת ביצועים באמצעות פרומפטים פתוחים ומקבילים בין שפות.

האם תת-המאגר שעבר עריכה אנושית כולל תשובות?

לא. בחלק dolly-human-edited השדה targets מכיל רק מקף. הוא מיועד לבדיקת יצירת טקסט חופשית מול הפרומפט בלבד ולא להשוואה מול תשובת ייחוס מוכנה מראש.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets בפייתון בעזרת הפקודה load_dataset ללא צורך בהרשמה מראש, טופסי אישור או מפתחות גישה. הקבצים שמורים בפורמט parquet קל משקל שאינו דורש משאבי זיכרון חריגים.

בטעינה מגדירים את החלק הרצוי, כמו aya_human_annotated. השדות המרכזיים הם inputs עבור הפרומפט, targets לתשובה הצפויה, language ו־script. שימו לב שבחלק dolly_human_edited שדה התשובות ריק לחלוטין ומכיל רק מקף.

from datasets import load_dataset

ds = load_dataset("CohereLabs/aya_evaluation_suite")

הרישיון

המאגר שוחרר תחת רישיון apache-2.0 המלא. מותר להשתמש בנתונים לכל צורך, כולל פיתוח מוצרים מסחריים, אימון מודלים פנימיים או הערכה מחקרית. אין חובת שיתוף של מודל שאומן עליו באותו רישיון. התנאי היחיד הוא מתן קרדיט מתאים למחברים ושמירה על תנאי הרישיון והודעות זכויות היוצרים בקוד או בהפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗