GPT
X

xstory_cloze

קוד פתוח

juletxaracc-by-sa-4.02023-01-28

תרגום מקצועי של מבחן StoryCloze ל־10 שפות נוספות שבודק היגיון יומיומי. מיועד למי שרוצה לבחון יכולות Few-Shot או Zero-Shot של מודלים בכמה שפות במקביל.

  • 11,360הורדות בחודש
  • 16לייקים

מה זה

המאגר מכיל תרגום מקצועי של גרסת אביב 2016 ממאגר StoryCloze המקורי באנגלית. המטרה היא בדיקת היגיון יומיומי, commonsense reasoning, באמצעות סיפורים קצרים בני ארבעה משפטים ושתי אפשרויות להמשך, מתוכן צריך לבחור את הסיום הנכון.

המבנה של כל רשומה כולל ארבעה משפטי קלט, שתי אופציות לסיום הסיפור, מזהה ייחודי, ותשובה נכונה שהיא 1 או 2. הנתונים מתורגמים ל־10 שפות שאינן אנגלית, כולל ערבית, רוסית, סינית, ספרדית, הינדית ועוד, כאשר הקבצים שומרים על התאמה מדויקת שורה מול שורה בין כל השפות.

בכל שפה יש בדיוק אותה חלוקה. 360 דוגמאות בסט האימון ו־1510 דוגמאות בסט ההערכה. הכרטיס לא מפרט מי היו המתרגמים בפועל או באילו תהליכי סינון השתמשו מעבר לציון העובדה שמדובר בתרגום מקצועי ששחררה חברת Meta AI.

מתאים ל

  • הערכת Few-Shot רב לשונית

    בדיקת יכולת המודל לבחור סיום הגיוני לסיפור על בסיס דוגמאות ספורות ב־11 שפות.

  • בנצ'מרק השוואתי בין שפות

    הרצת אותו מבחן בדיוק על שפות שונות הודות להתאמת השורות המושלמת בין הקבצים.

  • בדיקת היגיון בערבית

    הערכת מודלים מקומיים מול דאטה של הבנת סיטואציות יומיומיות בערבית מודרנית.

איפה זה נופל

הבעיה המרכזית היא היעדר מוחלט של עברית. בנוסף, כרטיס המאגר כמעט ריק ממידע מהותי ומציין שחסרים פרטים לגבי הטיות, איסוף המקור או פגיעה בפרטיות. הטקסטים מבוססים על סיפורים קצרים מ־2016 שתורגמו מאנגלית, כך שסביר להניח שיש בהם הטיות תרבותיות מערביות שלא הותאמו מקומית אלא רק תורגמו. גם היקף הנתונים קטן מאוד ולא מתאים לאימון מודל מאפס.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. המאגר מכיל 11 שפות שונות ביניהן אנגלית, ערבית, רוסית, סינית ועוד, אך אין בו עברית. אם המטרה שלכם היא מודל ייעודי לעברית, תצטרכו לתרגם אותו בעצמכם או לחפש חלופה.

מותר להשתמש בזה לפיתוח מסחרי?

כן, רישיון CC BY-SA 4.0 מתיר שימוש מסחרי, אך כולל דרישת ייחוס ושיתוף זהה. עליכם לציין את המקור, ואם אתם משנים או מרחיבים את הדאטהסט ומפיצים אותו, חובה לשחרר את הנגזרת באותו רישיון.

כמה מקום הדאטהסט תופס בדיסק?

הקבצים שוקלים מעט מאוד, כ־2.03 מגה-בייט בסך הכל. אין כאן דרישות חומרה כבדות ואפשר להוריד ולטעון אותו לזיכרון בשניות בכל סביבת פיתוח.

האם הדאטהסט מתאים לאימון מודלים מלא?

לא, הנתונים מיועדים בעיקר לבדיקה והערכה. יש בו רק 360 דוגמאות אימון ו־1510 דוגמאות בדיקה לכל שפה, כך שהוא בנוי לבדיקות Zero-Shot או Few-Shot ולא לאימון משמעותי.

איך טוענים

טוענים את הנתונים דרך ספריית datasets הרגילה או ישירות מקובצי ה־tsv במאגר. אין צורך באישור גישה מיוחד, וההורדה שוקלת כ־2.03 מגה-בייט בלבד. השדות הקריטיים לעבודה הם ארבעת משפטי הקלט, שתי אפשרויות הסיום והשדה שמכיל את התשובה הנכונה. בגלל שהקבצים מיושרים שורה מול שורה בין השפות השונות, קל להריץ הערכות מקבילות בלי לבנות מיפוי מיוחד.

from datasets import load_dataset

ds = load_dataset("juletxara/xstory_cloze")

הרישיון

הרישיון הוא CC BY-SA 4.0. מותר להשתמש בנתונים לצרכים מסחריים ומחקריים, אך חובה לתת קרדיט מתאים. תנאי השיתוף הזהה מחייב שכל יצירה נגזרת או שינוי של המאגר יופצו תחת אותו הרישיון בדיוק. אם אתם משלבים את הנתונים כדי ליצור דאטהסט חדש, תצטרכו לפתוח אותו באותם תנאים, אך זה לא הופך בהכרח משקולות של מודל שאומן עליו למוגנות באותו אופן.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗