GPT
I

include-base-44

קוד פתוח

CohereLabsapache-2.02024-11-29

  • chemistry
  • biology
  • legal
  • music
  • finance

שאלות רב ברירה ב 44 שפות שונות שנועדו לבחון ידע של מודלים. זה מאגר ממוקד לבנצ'מרק רב לשוני שלא דורש משאבי ענק כדי להריץ בדיקה מקיפה.

  • 12,500הורדות בחודש
  • 51לייקים

מה זה

כל רשומה היא שאלת מבחן אמריקאי עם ארבע אפשרויות בחירה ותשובה נכונה אחת. הנתונים מחולקים לתצורות לפי שפה, ומכילים מטא דאטה עשיר שכולל את המדינה, התחום, הנושא הספציפי, מאפיין אזורי ורמת הקושי של השאלה. ברוב השפות יש מבנה של ארבע עמודות נפרדות למסיחים, אם כי בחלק קטן, כמו גרסה מסוימת של הולנדית, האפשרויות שמורות כמערך יחיד.

המבנה הפנימי בכל שפה מורכב משני חלקים בלבד: סט בדיקה וסט ולידציה. סט הבדיקה מכיל לרוב סביב 500 עד 550 שאלות לכל שפה, וסט הולידציה קטן מאוד ונע בין 5 ל 40 דוגמאות בלבד. כרטיס הדאטהסט לא מפרט כיצד נאספו השאלות מהמקור או באילו שיטות סינון השתמשו.

מתאים ל

  • הערכת מודלים רב לשונית

    בדיקת יכולות מענה על שאלות ידע ב 44 שפות שונות תחת אותו פורמט בדיקה.

  • בדיקת ביצועים בעברית

    בחינת מודלים מקומיים מול 550 שאלות אמריקאיות עם חלוקה לרמות קושי ותחומים.

  • השוואת ביצועים בין שפות

    מדידת הפער ביכולת המודל בין שפות נפוצות לשפות עם משאבים מוגבלים.

איפה זה נופל

זה לא מאגר שמתאים לאימון מודלים אלא אך ורק להערכה ובדיקה. כמות הדוגמאות בכל שפה קטנה מדי, עם כ 550 שאלות מבחן בלבד, ולכן הוא לא יכול לשמש כבסיס ללימוד שפה. בנוסף, יש פערים בגדלים בין השפות, כאשר בגרמנית למשל יש רק 139 שאלות בטסט ובאסטונית 224, לעומת כ 550 ברוב השפות האחרות. הכרטיס אינו חושף מי כתב את השאלות או האם מדובר בתרגום מכונה, מה שמחייב בדיקה ידנית של איכות הניסוח לפני שמסתמכים על התוצאות.

שאלות
נפוצות

האם המאגר כולל תמיכה בעברית?

כן, קיימת תצורה מלאה בשם Hebrew. היא כוללת 550 שאלות בסט הבדיקה ועוד 10 שאלות בסט הוולידציה, כולל תיוג לתחום ורמת קושי.

האם מותר להשתמש בדאטהסט בפרויקט מסחרי?

כן, המאגר משוחרר תחת רישיון apache 2.0 שמתיר שימוש מסחרי מלא. צריך רק לצרף עותק של הרישיון ולתת קרדיט ליוצרים.

האם המאגר מתאים לאימון מודל שפה?

לא, הוא מיועד להערכה בלבד. מספר הדוגמאות בכל שפה עומד על מאות בודדות, כמות קטנה מכדי לאמן או לבצע כוונון עדין אפקטיבי.

כמה מקום הדאטהסט תופס בדיסק?

הנפח הכולל מזערי ביחס למאגרי שפה. כל שפה דורשת הורדה של בין עשרות קילובייטים למאות בודדות, כך שגם טעינת כל 44 השפות לוקחת מגהבייטים בודדים.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות ציון התצורה של השפה הרצויה, למשל Hebrew או Arabic. הקבצים שמורים בפורמט parquet, אין צורך בבקשת גישה מיוחדת, וגודל ההורדה לכל שפה זעיר ועומד על עשרות עד מאות קילובייטים בודדים בלבד. בעבודה איתו צריך לשים לב לשדה question, לארבעת שדות האפשרויות ולשדה answer שמחזיק את אינדקס התשובה.

from datasets import load_dataset

ds = load_dataset("CohereLabs/include-base-44")

הרישיון

רישיון apache 2.0 מתיר שימוש מסחרי ומחקר חופשי, ומאפשר לשנות ולהפיץ את המידע. הדרישה העיקרית היא מתן קרדיט מתאים ושמירה על תנאי הרישיון והודעות זכויות היוצרים. הרישיון אינו מגביל מודלים שנבדקו או אומנו על הנתונים, ואינו מחייב שיתוף של תוצרי הפיתוח באותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗