GPT
B

belebele

קוד פתוח

facebookcc-by-sa-4.02023-09-01

מבחן הבנת נקרא רב לשוני מקבילי לחלוטין שמכסה 122 ניבים ושפות. הוא מתאים למי שרוצה להשוות יכולות שפה של מודלים באותם תנאים ובאותן שאלות בדיוק.

  • 80,074הורדות בחודש
  • 132לייקים

מה זה

המאגר מכיל 900 שאלות לכל אחת מתוך 122 גרסאות השפה, ובסך הכל 109,800 שאלות. כל רשומה מבוססת על אחד מתוך 488 קטעי טקסט קצרים שנלקחו ממאגר FLORES-200, כשלכל קטע מוצמדות שאלה אחת או שתיים. לכל שאלה יש ארבע תשובות לבחירה ורק אחת מהן נכונה. בממוצע, קטע כולל כ־79.1 מילים, שאלה כ־12.9 מילים, ותשובה כ־4.2 מילים.

התוכן נוצר ועבר סינון אנושי מדוקדק במטרה לבחון רמות שונות של הבנת שפה. מכיוון שהנתונים מקבילים לגמרי בין כל השפות, המבנה מאפשר להריץ את אותה שאלה בדיוק על מודל במספר שפות ולהשוות את אחוזי הדיוק ללא תלות ברמת קושי שונה של המבחן. המאגר משמש כמבחן הערכה בלבד ואינו כולל נתוני אימון מובנים.

מתאים ל

  • הערכת עברית במודלי שפה

    בדיקת דיוק הבנת הנקרא בעברית מול 121 שפות אחרות על בסיס אותן שאלות בדיוק.

  • השוואת ביצועים רב לשונית

    מדידת יכולת אפס דוגמאות של מודלים במעבר בין שפות מרכזיות לשפות דלות משאבים.

  • בדיקת תרגום והעברה

    בחינת מודל שאומן באנגלית מול מבחן שאלות שמוגש בשפות יעד אחרות.

איפה זה נופל

זהו סט מבחן בלבד, ופייסבוק מדגישים שלא לאמן או לכוונן מודלים ישירות עליו כדי למנוע דליפת מידע. מי שחייב אימון משימתי נדרש להרכיב סט נפרד בעזרת סקריפט שמלקט נתונים ממאגרי צד שלישי באנגלית בלבד. בנוסף, הקטעים קצרים מאוד עם ממוצע של ארבעה משפטים, כך שהכלי אינו בודק הבנת הקשר ארוך או מסמכים שלמים.

שאלות
נפוצות

האם המאגר כולל עברית?

כן. המאגר כולל קובץ מלא של 900 שאלות בעברית תחת הסימול heb_Hebr. השאלות מקבילות לחלוטין לשאר השפות.

האם אפשר להשתמש בזה לאימון מודל מסחרי?

הרישיון הוא CC-BY-SA 4.0 שדורש שיתוף זהה, ולכן יש סיכון משפטי סביב סגירת המודל המאומן. בנוסף, היוצרים עצמם מגדירים את הנתונים כמבחן ביצועים בלבד ולא כמערך אימון.

כמה שוקל הדאטהסט והאם נדרש אישור מיוחד?

המאגר כולל 127 קבצים ואינו כבד, סך הכל סביב 100 אלף שורות טקסט בפורמט JSONL. הגישה חופשית לגמרי ואינה מצריכה אישור או פנייה לפייסבוק.

מאיפה הגיעו הטקסטים והשאלות?

הפסקאות מבוססות על מאגר התרגום FLORES-200. השאלות והתשובות נכתבו ועברו בקרת איכות על ידי מתייגים אנושיים כדי לבחון דרגות שונות של הבנת שפה.

איך טוענים

הקבצים שמורים במאגר בפורמט JSONL בחלוקה לפי קוד שפה וכתב, למשל heb_Hebr עבור עברית, או בתוך ארכיון zip בודד. אין צורך באישור גישה או בהרשמה מיוחדת, וההורדה פתוחה וישירה. שדות המפתח בכל רשומה כוללים את הפסקה, השאלה, ארבע התשובות האפשריות והתשובה הנכונה, שמוגדרת לפי אות בין A ל־D.

from datasets import load_dataset

ds = load_dataset("facebook/belebele")

הרישיון

הרישיון הוא CC-BY-SA 4.0. מותר להשתמש בנתונים לצרכים מסחריים ובלבד שניתן ייחוס מתאים למחברים. סעיף השיתוף הזהה מחייב שכל נגזרת של המאגר תופץ תחת אותו רישיון בדיוק. אימון מודל עלול לחשוף את המשקולות או את המערכת לחובת פתיחה דומה, ולכן גופים מסחריים מעדיפים להגביל את השימוש בו להערכה בלבד.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗