GPT
R

open-llm-leaderboard-old/results

קוד פתוח

open-llm-leaderboard-oldרישיון לא דווח2023-06-19

המאגר כולל תוצאות הרצה של אלפי מודלים במבחני השוואה שונים. הוא מתאים למי שחוקר ביצועים של מודלים בקוד פתוח או רוצה לנתח מגמות היסטוריות לפי מבחנים מקובלים.

  • 9,007הורדות בחודש
  • 51לייקים

מה זה

הרשומות במאגר הן קובצי JSON שמכילים ציונים ומדדים של מודלים שנשלחו לבדיקה בלוח התוצאות. כל קובץ מקושר למודל ספציפי וכולל חותמת זמן של הריצה, כמו התוצאות שנשמרו עבור גרסאות שונות של מודלים מסדרת Matter שנבדקו במרץ 2024.

הנתונים נאספו מתוך הרצות של כלי ההערכה של EleutherAI על פני שישה מבחנים מוכרים: ARC שבוחן שאלות מדעיות, HellaSwag שמיועד להסקה יומיומית, MMLU שבודק ידע ב־57 תחומים, TruthfulQA לבדיקת אמיתות, Winogrande למבחני הבנה לשונית, ו־GSM8k לפתרון בעיות מתמטיות. המאגר מציג את התוצאות הגולמיות של כל ריצה כזו בלי סינון ידני מדווח.

מתאים ל

  • ניתוח ביצועי מודלים

    השוואת ציונים של אלפי מודלים על גבי מבחנים כמו MMLU ו־GSM8k.

  • מחקר על מדדי הערכה

    בדיקת המתאם בין ביצועים במבחני ידע שונים לאורך היסטוריית ההגשות.

  • מעקב היסטורי של גרסאות

    בחינת ההשפעה של טכניקות כמו DPO על ביצועי מודלים לפי חותמות זמן.

איפה זה נופל

הנתונים במאגר מתייחסים לשפה האנגלית בלבד, ואין כאן שום מידע או בדיקה שרלוונטיים לשפה העברית. בנוסף, המאגר נקרא open-llm-leaderboard-old ופורסם במקור ביוני 2023, כך שהוא כולל בעיקר בדיקות ישנות של מודלים ולא משקף בהכרח את המצב העדכני. אין כאן דאטהסט שמתאים לאימון מודל שפה, אלא רק ציונים ומטא-דאטה טכני של ריצות קודמות.

שאלות
נפוצות

האם יש במאגר נתונים בעברית?

לא. כל המבחנים שנבדקו, בהם ARC, MMLU ו־TruthfulQA, מוגדרים תחת השפה האנגלית בלבד. אין במאגר טקסטים בעברית או הערכות של מודלים לשפה זו.

האם אפשר להשתמש במאגר לשימוש מסחרי?

לא דווח רישיון למאגר הזה. המשמעות היא שאין היתר רשמי לעשות בו שימוש מסחרי, ומומלץ להימנע משילוב הנתונים במוצר מסחרי ללא בדיקה משפטית.

האם המאגר מתאים לאימון של מודל שפה?

לא, המאגר לא מכיל טקסטים לאימון אלא קובצי תוצאות בפורמט JSON של מודלים שנבדקו במבחנים שונים. הוא מיועד למחקר, ניתוח נתונים והשוואת ביצועים בלבד.

איך המידע נאסף?

התוצאות נוצרו מהרצה של מודלים שהוגשו ללוח התוצאות מול מערכת הבדיקות של EleutherAI Harness. כל קובץ מתעד תוצאה של מודל מסוים במבחנים שנבחרו.

איך טוענים

המאגר מכיל 10,160 קבצים ומאורגן בתיקיות לפי שמות המשתמשים והמודלים שהוגשו, כאשר כל תוצאה שמורה בקובץ JSON נפרד. אין צורך בבקשת גישה מיוחדת כדי להוריד אותו, אבל כדי לעבוד איתו צריך לכתוב סקריפט שעובר על התיקיות וקורא את הקבצים הבודדים לפי שדות הציונים שמעניינים אתכם.

from datasets import load_dataset

ds = load_dataset("open-llm-leaderboard-old/results")

הרישיון

למאגר לא דווח רישיון בכלל. במצב כזה אין אישור מפורש לעשות בו שימוש מסחרי, ואי אפשר לדעת בוודאות אילו זכויות יוצרים חלות על תוצרי ההרצות. עבור מפתחים או חוקרים שרוצים לבנות על גבי הנתונים מוצר מסחרי, מדובר בסיכון משפטי שמונע שימוש חופשי.

הרישיון המלא ב־Hugging Face ↗