GPT
B

BixBench

קוד פתוח

futurehouseapache-2.02025-02-27

המאגר מרכז שאלות להערכת מודלים לצד קבצי מידע דחוסים לפי מזהי UUID. הוא מיועד למי שבונה או בוחן מודלים שצריכים להסיק מסקנות מתוך תיקיות נתונים מורכבות.

  • 8,587הורדות בחודש
  • 40לייקים

מה זה

המאגר כולל קובץ מרכזי בשם BixBench.jsonl ועוד 66 קובצי ארכיון בסיומת zip, שכל אחד מהם נקרא CapsuleFolder ומכיל מזהה ייחודי. הקבצים האלה מייצגים סביבות נתונים סגורות שסביבן נבנו השאלות.

בגרסה העדכנית, שנמצאת בענף הראשי ותחת התגית v1.5, כל שורה בקובץ הנתונים מייצגת שאלה בודדת במבנה שטוח. הצוות שפרסם את המאגר לא פירט בכרטיס מה מקור הנתונים המקורי בתוך הקפסולות, אך ציין שהגרסה הזו עברה סקירה מחודשת כדי לתקן שאלות שלא הכילו מספיק פרטים כדי לענות עליהן בפורמט פתוח. הגרסה המקורית עדיין נשמרת תחת התגית v1.0.

מתאים ל

  • הערכת מודלים על נתונים

    בדיקת יכולת המודל לענות על שאלות מורכבות שמסתמכות על קובצי הנתונים בקפסולות המצורפות.

  • בנצ'מרק למענה פתוח

    הרצת מבחני ביצועים במבנה של תשובות פתוחות על בסיס הגרסה המתוקנת v1.5.

  • השוואת ביצועים בין גרסאות

    בדיקת השינוי בדיוק של מודל נתון בין גרסת הבסיס v1.0 לגרסה המעודכנת.

איפה זה נופל

היוצרים עצמם מודים שהגרסה הראשונה סבלה מחוסר בפרטים, מה שהפך שאלות רבות לבלתי פתירות במענה פתוח. מעבר לזה, הכרטיס שותק לחלוטין לגבי השפות הנתמכות, תחומי הידע המדויקים או אופן איסוף הנתונים לקפסולות. אין כאן שום תיעוד על עברית, כך שחובה להניח שהתוכן באנגלית בלבד ולבדוק ידנית את הקפסולות לפני שמסתמכים עליו בהערכת ביצועים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון המדווח הוא apache-2.0, שמאפשר שימוש מסחרי, שינוי של הקבצים ושילוב שלהם במוצרים מסחריים. הדרישה המרכזית היא מתן ייחוס מתאים ליוצרים ושמירה על תנאי הרישיון בהפצה.

האם יש במאגר תמיכה בעברית?

הכרטיס לא מזכיר תמיכה בעברית או בשפות נוספות מעבר לאנגלית. בהתחשב באופי המאגר ובמבנה השאלות, לא מומלץ להסתמך עליו לבדיקות שדורשות עיבוד שפה בעברית בלי לבדוק קודם את קובץ ה־JSONL ישירות.

מה ההבדל בין הגרסה הנוכחית לגרסה הראשונה?

הגרסה המקורית ב־v1.0 הכילה שאלות רבות שלא כללו מספיק פרטים כדי לענות עליהן בפורמט פתוח. בגרסה הראשית הנוכחית, v1.5, הצוות תיקן את השאלות ושיטח את המבנה לשאלה אחת בכל שורה.

מאיפה נאספו הנתונים שבקפסולות?

המידע הזה לא פורסם בכרטיס המאגר. היוצרים ציינו רק שיש 66 תיקיות זיפ עם מזהים ייחודיים שמתאימות לשאלות, והפנו לעדכונים עתידיים במאמר שלהם לקבלת פרטים נוספים.

איך טוענים

כדי לעבוד איתו צריך להוריד את הקובץ BixBench.jsonl ואת קובצי הזיפ התואמים לפי מזהי ה־UUID שמופיעים בשאלות. הגישה למאגר פתוחה לחלוטין ללא צורך בהרשאה מוקדמת. קריאת הנתונים נעשית ישירות בכל ספריית עיבוד טקסט סטנדרטית שמסוגלת לקרוא קובצי JSONL, אבל צריך לקחת בחשבון את חילוץ קובצי הזיפ המצורפים כדי להגיע לנתונים המלאים שסביבם נשאלה השאלה.

from datasets import load_dataset

ds = load_dataset("futurehouse/BixBench")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי והפצה של הנתונים, ואינו מחייב אתכם לשחרר מודלים שאומנו עליו תחת אותו רישיון. התנאי העיקרי הוא מתן קרדיט ושמירה על הודעות הרישיון המקוריות של היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗