GPT
A

AA-LCR

קוד פתוח

ArtificialAnalysisapache-2.02025-08-05

יש כאן גם סקירה על Artificial Analysis עצמו.

מבחן ביצועים של 100 שאלות קשות הדורשות הסקת מסקנות על פני סטים של מסמכים ארוכים. כל שאלה מגיעה עם כ־100 אלף טוקנים של הקשר כדי לבדוק מודלים שקורסים בחלונות ארוכים.

  • 7,762הורדות בחודש
  • 38לייקים

מה זה

המאגר מורכב מ־100 שאלות טקסטואליות ו־30 סטים של מסמכים, שכוללים יחד 234 קבצים וכמעט שלושה מיליון טוקנים. הנתונים מתחלקים לשבעה תחומים, כשרוב הנפח נמצא במסמכי חברות כמו דוחות כספיים עם 63 שאלות ו־92 מסמכים. שאר השאלות מתפזרות על התייעצויות ממשלתיות, דוחות תעשייה, מאמרים אקדמיים, מסמכים משפטיים, חומרי שיווק ודוח סקר יחיד.

סטודנטים לתואר ראשון ניסחו את השאלות ובדקו אותן מול דגמים כמו GPT-4o-mini, Llama-3.1-70B ו־Gemini 1.5 Flash כדי לוודא שהם נכשלים בהן. שאלות שלא דרשו הצלבת נתונים מכמה מקורות או שנפתרו בשליפה פשוטה נפסלו. כל שאלה עברה אימות ידני על ידי בודקים אנושיים, שהגיעו ל־40 עד 60 אחוזי דיוק בניסיון ראשון, ורק שאלות שלפחות אדם אחד הצליח לפתור נכנסו פנימה.

מתאים ל

  • בדיקת הסקה בהקשר ארוך

    בחינת יכולת המודל לשלוף ולחבר עובדות שמפוזרות על פני 100 אלף טוקנים של הקשר.

  • הערכת ביצועים פיננסיים

    מדידת דיוק בניתוח דוחות כספיים וחישוב מדדים מורכבים מכמה דוחות שנתיים שונים.

  • בנצ'מרק להשוואת מודלים

    הרצת בדיקה השוואתית קשיחה בין מודלי קצה באמצעות שופט אוטומטי מבוסס פרומפט.

איפה זה נופל

זהו לא מאגר לאימון אלא בנצ'מרק בלבד, עם 100 דוגמאות בלבד והטיה ברורה לטובת דוחות פיננסיים של חברות. החומרים כולם באנגלית ומבוססים על מסמכים ציבוריים עד שנת 2024. בגרסה הראשונה התגלו בעיות ברישום התשובות, כמו שברים עשרוניים במקום אחוזים ומספרי תאריכים מרוסקים מאקסל, כולל ארבע תשובות שהיו שגויות מהיסוד ותוקנו רק בגרסה 1.1.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

השאלות עצמן מותרות לשימוש מסחרי תחת רישיון Apache 2.0. הטקסטים של המסמכים נאספו ממקורות ציבוריים ברשת והיוצרים לא מעניקים עליהם רישיון, כך שלמוצר מסחרי כדאי להשתמש בהם לבדיקות פנימיות בלבד.

האם יש בדאטהסט טקסטים בעברית?

לא. כל 234 המסמכים ו־100 השאלות כתובים באנגלית בלבד. המאגר משקף מסמכים עסקיים, ממשלתיים ואקדמיים דוברי אנגלית.

איך יצרו את השאלות ומאיפה המסמכים?

סטודנטים לתואר ראשון חיברו שאלות על גבי סטים של מסמכים ציבוריים כמו דוחות חברות והתייעצויות חקיקה. הם השתמשו במודלים כמו GPT-4o-mini כדי לוודא שהשאלות קשות מדי עבורם, וכל שאלה נבדקה ואומתה ידנית על ידי בני אדם.

במה הוא שונה ממאגרי שליפה ארוכים רגילים?

הוא לא בודק שליפת עובדה בודדת מתוך מסמך ענק. התשובות דורשות שילוב מידע, עיבוד לוגי או חישוב מתמטי על פני כמה מסמכים שונים שמוזנים יחד בחלון ההקשר.

איך טוענים

טוענים את קובץ ה־CSV בשם AA-LCR_Dataset.csv ואת קובץ ה־ZIP שמכיל את הטקסטים שחולצו מראש. אין צורך בבקשת גישה מיוחדת, הקבצים פתוחים להורדה ישירה דרך Hugging Face. כדי לבנות את הפרומפט המדויק, מחברים את המסמכים לפי הסדר שמופיע בעמודת שמות הקבצים ומריצים את השאלה בסוף. ההערכה המקורית מסתמכת על בדיקת שוויון באמצעות מודל חיצוני עם פרומפט ייעודי שמחזיר תשובה בפורמט JSON.

from datasets import load_dataset

ds = load_dataset("ArtificialAnalysis/AA-LCR")

הרישיון

השאלות והתשובות מפורסמות תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי והפצה, כל עוד שומרים על הודעת זכויות היוצרים ומציינים שינויים שבוצעו. לגבי המסמכים עצמם, היוצרים מציינים שהם ייצוג טקסטואלי של חומרים ציבוריים ואינם מחזיקים בזכויות עליהם, כך שאין עליהם רישיון רשמי וצריך לבדוק את מקורות המקור לפני שימוש מעבר להערכה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗