GPT
L

lila

קוד פתוח

allenaicc-by-4.02023-02-08

המאגר מרכז מבחני ביצוע להסקה מתמטית תחת מסגרת אחידה. הוא מיועד למי שרוצה לאמן או להעריך מודלים על פתרון בעיות מתמטיות מגוונות.

  • 13,369הורדות בחודש
  • 33לייקים

מה זה

הנתונים נשענים על המאמר המדעי שפרסמו החוקרים בכנס EMNLP 2022, ומטרתם לבנות מבחן ביצועים אחיד ליכולות הסקה מתמטית. במקום לעבוד עם מקורות בודדים ומפוזרים, המאגר מאחד בתוכו מגוון דאטהסטים קיימים שפותחו במקור לצורכי מחקר שונים של מתמטיקה בשפה טבעית.

כרטיס המאגר עצמו דל בפרטים טכניים ישירים ומפנה בעיקר לקובץ המקורות ולמאמר המלא. מהקבצים עולה שהאיחוד דרש יצירת סקריפט טעינה ייעודי בשם lila.py, שמגדיר כיצד לחלץ את הדוגמאות מתוך המקורות המקוריים השונים ולהציג אותן במבנה אחיד. מי שרוצה לדעת בדיוק מאילו משימות המאגר מורכב יצטרך לקרוא במאמר המקושר או לבדוק את קובץ המקורות המצורף בריפו.

מתאים ל

  • בנצ'מרק להסקה מתמטית

    הערכת היכולת של מודלי שפה לפתור בעיות מתמטיות מגוונות על גבי מבחן מאוחד.

  • אימון מודלים ייעודיים

    כוונון עדין של מודלים פתוחים על משימות חישוב והסקה רב שלביות.

  • מחקר על שילוב קוד וחישוב

    בדיקת גישות שמשלבות יצירת תוכנה ופתרון בעיות כמותיות.

איפה זה נופל

כרטיס התיעוד אינו מפרט חלוקה מובנית, גדלים מדויקים או הטיות ידועות של הנתונים. המאגר נבנה סביב ספרות מחקרית באנגלית, ולכן אין לצפות לתמיכה בבעיות מנוסחות בעברית. בנוסף, כיוון שמדובר באיחוד של מקורות שונים שפורסמו עד 2022, ייתכן שחלק מהנתונים הופיעו כבר בדאטהסטים אחרים, מה שמחייב בדיקת זיהום נתונים לפני שמשתמשים בו להערכת מודלים חזקים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא cc-by-4.0 והוא מתיר שימוש מסחרי מלא. התנאי היחיד הוא מתן קרדיט למחברים המקוריים ולמאמרים שמהם נלקחו הנתונים.

האם הבעיות במאגר כוללות עברית?

לא. הנתונים מגיעים ממחקרים אקדמיים באנגלית והבעיות מנוסחות באנגלית בלבד. אם יש צורך בבדיקה בעברית, תצטרכו לתרגם את השאלות בעצמכם.

איך המאגר הזה שונה ממאגרי מתמטיקה אחרים?

הוא מאחד עשרות מקורות שונים לכדי ממשק ופורמט אחיד אחד. במקום לבדוק כל דאטהסט בנפרד, מקבלים בנצ'מרק שמכסה סוגים שונים של חשיבה כמותית.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה של Hugging Face באמצעות המזהה allenai/lila. אין צורך לבקש אישור גישה מוקדם או למלא טופס, המאגר פתוח לחלוטין לציבור. הטעינה מתבססת על סקריפט הפייתון lila.py שנמצא במאגר ומטפל בכל התהליך מאחורי הקלעים. המאגר מכיל רק שלושה קבצים, כולל התיעוד וסקריפט הטעינה, כך שלא מורידים קבצי ענק ישירות מראש העמוד אלא נותנים לקוד למשוך את הנתונים לפי ההגדרות שלו.

from datasets import load_dataset

ds = load_dataset("allenai/lila")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0 שמתיר שימוש מסחרי, שינוי והפצה של התוכן. התנאי המרכזי הוא מתן קרדיט מתאים ליוצרים. המפרסמים מדגישים שיש לצטט לא רק את המאמר שלהם, אלא גם את מקורות הנתונים המקוריים שמהם המאגר נאסף, כמפורט בקובץ המקורות שלהם.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗