GPT
A

ASI-Bench-seed31415

קוד פתוח

Apexintelligence-AIapache-2.02026-07-28

  • benchmark
  • agents
  • ai-for-science
  • scientific-reasoning

המאגר מרכז משימות מחקר מדעי ברמת פרויקט שנועדו לבחון יכולות אוטונומיות של מודלים. הוא מעניין את מי שמחפש הערכה מורכבת בהרבה מעוד שאלון רב ברירה רגיל.

  • 4,103הורדות בחודש
  • 20לייקים

מה זה

המאגר כולל פחות מאלף רשומות שמחולקות לשישים משימות מחקר מדעיות ברמת פרויקט, על פני 11 תחומים שונים כמו אסטרונומיה. כל משימה פוצלה לארבע רמות הנחיה, החל מהדרכה מתודולוגית מלאה, דרך ציון השיטה בלבד או הגדרת יעד הנתונים בלבד, ועד להוספת מידע לא רלוונטי שמקשה על הביצוע.

המבנה הפנימי בנוי מתיקיות נפרדות לכל משימה עם הסיד הקבוע 31415. בתוך כל תיקייה יש קובצי פרומפט בפורמט מרקדאון, תיקיית נתונים שמכילה קבצים מסוגים כמו JSON או מערכי npy, תיקיית רפרנס לבדיקת תוצאות, וקובצי מטא דאטה של התשתית.

מתאים ל

  • הערכת סוכני קוד ומחקר

    בדיקת היכולת של מודלים להתמודד עם משימות מדעיות מורכבות ועבודה עם קבצים.

  • מבחן עמידות לרעש בהנחיות

    השוואת ביצועי המודל כשהוא מקבל הוראות מלאות מול הנחיות שכוללות מידע לא רלוונטי.

  • בדיקת פתרון בעיות אוטונומי

    בחינת יכולת המודל להגיע לתוצאה מדעית נכונה כשרק המטרה והנתונים מוגדרים.

איפה זה נופל

המאגר כולו באנגלית בלבד ואין בו שום תמיכה בעברית. היקף הרשומות קטן מ־1,000, כיוון שמדובר במשימות פרויקט מורכבות ולא במאגר אימון רחב. המפרסמים לא פירטו בכרטיס תהליכי סינון, בקרת איכות או חסרונות של הנתונים, ולכן חובה לבדוק ידנית את המשימות לפני שמסתמכים על הציון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

כן, הרישיון הוא Apache 2.0 שמתיר שימוש מסחרי בלי הגבלה כזו. צריך רק להקפיד על מתן קרדיט ולצרף את נוסח הרישיון.

האם יש במאגר משימות או נתונים בעברית?

לא. המאגר מוגדר ומכיל תוכן באנגלית בלבד, ולא כולל נתונים מקומיים.

איזה סוגי קבצים יש במאגר?

הוא כולל 1,531 קבצים שמחולקים לתיקיות משימה. בין הקבצים תמצאו מסמכי Markdown להנחיות, קובצי JSON למטא דאטה וקלטים, ומערכי npy לעבודה עם נתונים מספריים.

האם המאגר מתאים לאימון מודלים רגיל?

לא מומלץ לבנות עליו כבסיס אימון. מדובר במאגר הערכה שמכיל פחות מאלף רשומות שמחולקות לשישים משימות עומק, ולא בדאטהסט אימון רחב.

איך טוענים

לא מדובר בטבלת נתונים סטנדרטית שטוענים בשורה אחת. המאגר מורכב מ־1,531 קבצים שדורשים הורדה ישירה או סנכרון דרך כלי הבנצ'מרק הרשמי בגיטהאב. אין צורך באישור גישה מיוחד, אבל צריך לעבוד ישירות מול עץ התיקיות כדי לקרוא את קובצי ה־JSON, ה־Markdown ומערכי ה־npy.

from datasets import load_dataset

ds = load_dataset("Apexintelligence-AI/ASI-Bench-seed31415")

הרישיון

הרישיון הוא Apache 2.0. הוא מאפשר שימוש מסחרי מלא, שינוי של הקבצים והפצה שלהם. התנאי העיקרי הוא מתן קרדיט וייחוס ליוצרים, לצד הכללת עותק הרישיון המקורי. אימון או הערכה על החומרים אינם מחייבים אתכם לפתוח את הקוד או את המודל שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗