GPT
M

mrcr

קוד פתוח

openaimit2025-04-11

openai עומדים גם מאחורי Sora, ויש עליו סקירה כאן.

מבחן ביצועים להקשר ארוך שבודק שליפת מידע מתוך שיחות סינתטיות עמוסות. הוא נועד לבדוק אם מודל מזהה מופע ספציפי של בקשה שחוזרת על עצמה שוב ושוב.

  • 6,126הורדות בחודש
  • 219לייקים

מה זה

המאגר כולל שיחות ארוכות ומרובות תורות בין משתמש לעוזר, שנוצרו כולן באמצעות gpt4o. בתוך השיחה המשתמש מבקש טקסטים קצרים סביב נושאים מסוימים, כמו שיר על חיה או פוסט על סלעים, כאשר בקשות זהות מופיעות שוב ושוב לאורך הטקסט. בסוף השיחה המודל נדרש לשלוף מופע מדויק לפי סדר, למשל השיר השני שנכתב על אותו נושא, ולהוסיף לו מחרוזת קבועה בתחילת התשובה.

התוכן מחולק לפי רמות קושי שמוגדרות על ידי כמות המחטים בטקסט: שתיים, ארבע או שמונה. הנתונים נבנו מתוך שילוב של 438 ישויות שונות ועשרה פורמטים שונים של כתיבה, ומסודרים במדרגות אורך לפי כמות טוקנים, מטווח של 4,096 ועד מעל מיליון טוקנים בכל דגימה, עם 100 דגימות לכל מדרגת גודל.

מתאים ל

  • בדיקת זיכרון בהקשר ארוך

    מדידת יכולת המודל לשלוף פרטים מדויקים מתוך שיחות ענק של עד מיליון טוקנים.

  • הערכת עקיבה אחר סדר

    בחינה אם המודל מסוגל להבדיל בין מופעים שונים של אותה בקשה בדיוק לפי סדר הגעתם.

  • עמידות מול מסיחים

    מדידת ביצועים כשהמידע המבוקש מנוסח בדיוק באותו סגנון של שאר הטקסט בשיחה.

איפה זה נופל

כל הטקסטים נוצרו בצורה סינתטית על ידי gpt4o באנגלית, כך שאין כאן שום מידע בעברית או תרחישי שיחה אנושיים אמיתיים. בנוסף, הכרטיס מדווח על תקלות בייצור שדרשו תיקון: כעשרה אחוזים מהרשומות המקוריות הכילו יותר מדי מופעים של בקשת המטרה, ובחמישה אחוזים תשובת האמת הייתה שגויה. לצורך כך נוסף שדה תאריך שמעיד על רשומות שתוקנו, ויש לקחת זאת בחשבון כשמשווים תוצאות ישנות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה לצרכים מסחריים?

כן. הרישיון הוא MIT, וזה אומר שניתן להשתמש בנתונים להערכה, לאימון ולמוצרים מסחריים ללא תשלום תמלוגים, כל עוד שומרים על תנאי הייחוס של הרישיון.

האם יש בדאטהסט תמיכה בעברית?

לא. כל השיחות והטקסטים נוצרו באנגלית בלבד באמצעות gpt4o, ואין במאגר נתונים בשפות אחרות.

איך המידע נוצר ונאסף?

הנתונים לא נאספו משיחות אמיתיות אלא יוצרו סינתטית. השתמשו ב־438 ישויות ובעשרה פורמטים של כתיבה, ויצרו שיחות ארוכות שבהן הבקשות המבוקשות נבלעות בין תכנים שנראים זהים.

במה הוא שונה ממבחני מחט בערימת שחת רגילים?

במקום לחפש עובדה אחת ייחודית, יש כאן כמה מופעים זהים של אותה בקשה בתוך שיחה אחת. המודל חייב להבין את הסדר המדויק של המופעים ולהחזיר רק את המופע הספציפי שהתבקש.

איך טוענים

הנתונים מגיעים בקובצי parquet שמחולקים לתיקיות לפי כמות המחטים, 2needle, 4needle ו־8needle, ללא צורך באישור גישה מיוחד. כדי להריץ בדיקה תקינה צריך לחלץ את הטקסט, לוודא שהמודל מוסיף את קוד האימות האלפאנומרי בתחילת הפלט, ולמדוד את התוצאה מול תשובת המקור בעזרת SequenceMatcher מספריית difflib בפייתון, כפי שמוגדר במפרט הבדיקה.

from datasets import load_dataset

ds = load_dataset("openai/mrcr")

הרישיון

הרישיון המדווח הוא MIT. מדובר ברישיון קוד פתוח מתירני מאוד, שמאפשר שימוש חופשי, שינוי, הפצה ומסחור של המידע והקוד, בכפוף לשמירה על הצהרת זכויות היוצרים המקורית. אין מגבלה על שימוש מסחרי במודלים שנבדקים או מאומנים בעזרתו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗