GPT
A

AA-Omniscience-Public

קוד פתוח

ArtificialAnalysisapache-2.02025-11-17

יש כאן גם סקירה על Artificial Analysis עצמו.

המאגר מכיל שאלות מורכבות ממגוון תחומים שנועדו לבדוק אם מודל באמת יודע עובדות או ממציא תשובות. הוא מיועד למי שרוצה למדוד נטייה להזיות ולהעניש ניחושים שגויים במקום רק לבדוק דיוק פשוט.

  • 9,017הורדות בחודש
  • 48לייקים

מה זה

הנתונים כוללים שש מאות שאלות פתוחות עם תשובות קצרות וחד משמעיות, כמו שמות, תאריכים ומספרים. הרשומות האלו הן מדגם של עשרה אחוזים מתוך בנצ'מרק רחב של ששת אלפים שאלות שמחולק לפי תחומים בעלי משמעות כלכלית. השאלות נוסחו וסוננו באמצעות סוכן אוטומטי ששאב מידע ממקורות סמכותיים, וסינן שאלות דומות, מעורפלות או קלות מדי לאחר בדיקה מול מודלים מובילים.

הקובץ המרכזי במאגר הוא קובץ טבלאי פשוט שמכיל את השאלות שנבחרו כדי לייצג את הביצועים הכלליים של המאגר המלא. לצד השאלות עצמן, המאגר מציג מתודולוגיית בדיקה שבה מנחים את המודל לא לענות אם הוא אינו בטוח במידע, כדי לבחון האם הוא יודע להימנע ממענה כשאין לו ידע מספק.

מתאים ל

  • מדידת הזיות במודלים

    בדיקה אם המודל בוחר להימנע ממענה כשהוא לא יודע את התשובה במקום להמציא עובדות שגויות.

  • השוואת ביצועים כללית

    הרצת בדיקה מהירה מול שש מאות שאלות כדי לקבל אינדיקציה ראשונית לרמת הידע הכללי של מודל.

  • כיול מודל שופט

    שימוש בשאלות ובתשובות הקצרות כדי לבחון ולכייל הנחיות בדיקה עבור מודל שמעריך תשובות עובדתיות.

איפה זה נופל

המדגם הציבורי קטן מאוד וכולל שש מאות שאלות בלבד. הכרטיס מבהיר במפורש שהמדגם נותן אינדיקציה כללית בלבד, ושאי אפשר להסתמך עליו כדי להסיק מסקנות על ביצועי המודל בתחום ספציפי או בנושא בודד. בנוסף, השאלות נוצרו כולן על ידי סוכן אוטומטי ולא נכתבו ידנית על ידי מומחי תוכן אנושיים, והבדיקה דורשת שימוש במודל שופט חיצוני להערכת התשובות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הרישיון המדווח הוא Apache 2.0, שמתיר שימוש מסחרי, עריכה ושילוב בקוד או במוצרים, בתנאי ששומרים על תנאי הייחוס והזכויות המקוריים.

האם המאגר מתאים לבדיקת מודלים בעברית?

לא. השאלות והתשובות מנוסחות באנגלית ומתאימות לבחינת ביצועים בשפה הזו בלבד. אין במאגר נתונים מקומיים או תרגום לשפות אחרות.

למה המאגר מכיל רק שש מאות שאלות?

המאגר הציבורי הוא תת קבוצה של עשרה אחוזים מתוך סט שלם של ששת אלפים שאלות. היוצרים שמרו את רוב השאלות סגורות כדי למנוע זיהום של הבנצ'מרק על ידי מודלים שמתאמנים על הרשת.

האם אפשר להסיק מהתוצאות על רמת המודל בתחום כמו רפואה או משפטים?

לא מומלץ. יוצרי הדאטהסט מציינים במפורש שהמדגם הציבורי קטן מכדי לייצג ביצועים אמינים ברמת התחום הבודד, והוא נועד רק להערכה כללית של המודל כולו.

איך טוענים

העבודה מול המאגר ישירה מאוד. מורידים את קובץ הטבלה AA-Omniscience_dataset_public.csv שיושב במאגר הפתוח, בלי צורך בבקשת גישה מיוחדת או אישור מראש. קובץ הנתונים שוקל מעט מאוד ומכיל שדות של שאלות, תחומים ותשובות קצרות. לצורך בדיקה לפי הפרוטוקול המקורי, מזינים למודל הנחיה מקדימה הדורשת תשובה בלבד ללא הסברים ומעודדת הימנעות ממענה כשחסר ידע, ולאחר מכן משתמשים במודל שופט לסיווג התוצאה לנכון, לא נכון, נכון חלקית או חוסר מענה.

from datasets import load_dataset

ds = load_dataset("ArtificialAnalysis/AA-Omniscience-Public")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי והפצה של הנתונים. הרישיון דורש מתן קרדיט וציון שינויים שנעשו, אך אינו מחייב שיתוף של מודלים שאומנו עליו תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗