GPT
R

reasoning

קוד פתוח

livebenchרישיון לא דווח2024-06-06

מבחן ביצועים שמנסה לפתור את בעיית זיהום המידע במודלי שפה בעזרת שאלות עדכניות. המטרה כאן היא בדיקת יכולות הסקת מסקנות עם תשובות חד משמעיות שניתן לבדוק אוטומטית.

  • 7,513הורדות בחודש
  • 19לייקים

מה זה

המאגר הזה מרכז שאלות להערכת יכולות הסקת מסקנות של מודלים, כחלק מפרויקט רחב יותר שכולל 18 משימות שונות בשש קטגוריות. הרעיון המרכזי של היוצרים הוא למנוע מצב שבו המודל פשוט מדקלם תשובות שראה כבר באימון, ולכן המידע מתבסס על מקורות חדשים כמו מאמרים מארכיב, חדשות, תקצירי סרטים ממאגר IMDb ודאטהסטים שפורסמו לאחרונה.

לפי הכרטיס, כל שאלה מגיעה עם תשובה אובייקטיבית שניתנת לאימות ישיר. זה חוסך את הצורך להשתמש במודל שפה אחר בתור שופט, שיטה שמוסיפה בדרך כלל המון רעש והטיות למדידה. מעבר לכך, היוצרים מצהירים שהם מעדכנים שאלות על בסיס חודשי כדי לשמור על המבחן רלוונטי מול מודלים חדשים שיוצאים לשוק.

מתאים ל

  • מבחן ביצועים להסקה

    בדיקת יכולת המודל להסיק מסקנות מורכבות מול תשובות אמת שניתנות לבדיקה מדויקת.

  • מדידה נקייה מזיהום

    הערכת ביצועים על מידע שנאסף ממקורות חדשים יחסית, כדי לוודא שהמודל לא פשוט שינן את הטקסט.

  • בדיקה ללא שופט חיצוני

    הרצת סקריפט בדיקה אוטומטי שמשווה לתשובות סגורות, בלי להסתמך על שיפוט של מודל נוסף.

איפה זה נופל

יש פה בלבול מובנה שכדאי לשים לב אליו: המאגר מוגדר כחלק של הסקת מסקנות, אבל הטקסט בכרטיס מציין שזו קטגוריית מעקב אחר הוראות. מעבר לזה, המקורות מבוססים על תכנים באנגלית כמו מאמרי ארכיב וחדשות, כך שאין כאן שום ייצוג לעברית. אם המודל שלכם מיועד לפעול בשפה המקומית, הבדיקה הזו לא תגיד לכם הרבה על היכולות שלו מול משתמש ישראלי. בנוסף, חסר פירוט מלא בכרטיס על חלוקת השדות המדויקת.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

לא מומלץ בכלל כרגע. הדאטהסט פורסם בלי רישיון מוגדר, וכל עוד היוצרים לא ציינו תנאי שימוש חופשיים, אין לכם היתר חוקי לבנות עליו מוצרים או לאמן מודלים לשימוש מסחרי.

האם הדאטהסט כולל שאלות בעברית?

לא. התכנים נאספו ממקורות באנגלית כמו מאמרים מארכיב, אתר IMDb וכתבות חדשות. הוא לא מתאים להערכת מודלים בעברית.

איך המאגר מונע דליפה של מבחנים לאימון?

הפרויקט מתבסס על שחרור חודשי של שאלות חדשות ושימוש בנתונים עדכניים מאוד. הרעיון הוא להקדים את זמני האימון של המודלים כדי שהם לא יפגשו את המבחנים מראש.

האם צריך מודל נוסף כדי לבדוק את התוצאות?

לא, וזה אחד היתרונות הבולטים שמתוארים בכרטיס. לכל שאלה יש תשובה נכונה שניתנת לאימות ישיר, כך שהבדיקה היא אוטומטית וחד משמעית בלי צורך במודל שופט.

איך טוענים

הנתונים יושבים בקובץ parquet יחיד תחת תיקיית data, לצד קובץ התיעוד. אפשר למשוך אותו ישירות עם ספריית datasets של Hugging Face בלי שום צורך לבקש אישור גישה מוקדם או להמתין לאישור ידני. מדובר בחלק מקטגוריית משימות מוגדרת מראש, והמבנה כולל את השאלות לצד פתרונות הייחוס האובייקטיביים הנדרשים לצורך ההרצה והבדיקה.

from datasets import load_dataset

ds = load_dataset("livebench/reasoning")

הרישיון

היוצרים לא הגדירו רישיון שימוש במאגר. מבחינה משפטית, היעדר רישיון אומר שכל הזכויות שמורות ואין הרשאה ברורה להשתמש בחומרים, לא למחקר ובוודאי שלא לפיתוח מוצרים מסחריים. אסור להניח שמותר לאמן עליו מודלים מסחריים בלי לקבל מהם אישור מפורש.

הרישיון המלא ב־Hugging Face ↗