GPT
C

CL-bench

קוד פתוח

tencentother2026-01-26

  • context-learning
  • long-context
  • benchmark

המאגר בוחן אם מודל באמת קולט ידע חדש מההקשר שסיפקתם לו, במקום לדקלם מהאימון. הוא עושה את זה באמצעות משימות מורכבות של למידה מתוך הקשר עם מערך בדיקה מפורט.

  • 1,306הורדות בחודש
  • 147לייקים

מה זה

בפנים מחכות 1,899 משימות שנבנו כדי לבדוק איך מודלים מתמודדים עם חוקים חדשים, נהלים מורכבים וחוקיות מתוך נתונים. הנתונים מחולקים לארבע קטגוריות ראשיות ו־18 תת-קטגוריות, למשל יישום מערכות חוקים כמו מכניקות משחק. בכל הקשר ממוצע יש כ־3.8 משימות שונות.

המבנה של כל רשומה כולל שלושה שדות עיקריים. שדה ההודעות מגיע בפורמט השיחה המוכר של OpenAI עם הודעת מערכת והודעת משתמש שמכילה את ההקשר והמשימה. בנוסף יש מטא-דאטה לזיהוי וסיווג, ורשימת קריטריונים מפורטת להערכה עם ממוצע של 63.2 סעיפי בדיקה לכל הקשר.

מתאים ל

  • מבחן ביצועים למודלים

    הערכת היכולת של המודל ללמוד חוקים חדשים ישירות מהפרומפט בלי להסתמך על ידע מוקדם.

  • בדיקת מערכות מבוססות הקשר

    בחינה של פתרונות שדורשים הפעלת לוגיקה עסקית מורכבת מתוך מסמכי נהלים ארוכים.

  • השוואה ללוח התוצאות

    מדידת ביצועי המודל מול מודלים קיימים לפי עשרות סעיפי הבדיקה שמוגדרים במאגר.

איפה זה נופל

המאגר כולו באנגלית בלבד, כך שהוא לא יעזור לכם לבדוק הבנת הקשר בעברית או בשפות אחרות. מעבר לזה, הכרטיס לא מפרט מאיפה בדיוק נלקחו הטקסטים והחוקים או איך הם סוננו ונבדקו מפני שגיאות. אם המודל שלכם מתקשה לעקוב אחרי הוראות ארוכות מאוד במכה אחת, קחו בחשבון שיש כאן עשרות סעיפי הערכה לכל הקשר.

שאלות
נפוצות

האם מותר לאמן מודל על הדאטהסט הזה?

לא, הרישיון אוסר על כך במפורש. מותר להשתמש בו אך ורק לצורכי הערכה, בדיקה והשוואת ביצועים. כל שימוש לאימון, כוונון עדין או זיקוק מודלים מהווה הפרה של תנאי השימוש.

האם יש בדאטהסט תמיכה בעברית?

לא, הדאטהסט מוגדר ומכיל נתונים בשפה האנגלית בלבד. אם תרצו לבדוק ביצועים בעברית, תצטרכו לתרגם את המשימות בעצמכם או לחפש מקור אחר. קחו בחשבון שתרגום עשוי לשנות את הדיוק של סעיפי ההערכה.

איך מעריכים את התשובות של המודל בפועל?

כל רשומה כוללת שדה ייעודי בשם rubrics שמכיל עשרות קריטריונים נקודתיים לבדיקה. בממוצע תמצאו מעל 63 סעיפים לכל הקשר, שבודקים האם המודל עמד בכל ההנחיות שנמסרו לו. מומלץ לבדוק את קוד ההערכה במאגר הגיטהאב של הפרויקט כדי להריץ את הבדיקה בצורה תואמת.

מה מייחד אותו מדאטהסטים אחרים של יצירת טקסט?

בניגוד למאגרי שאלות ותשובות רגילים, הוא לא בודק ידע כללי שהמודל שינן בעבר. המשימות כאן מחייבות להבין מערכות חוקים, פרוצדורות והקשרים חדשים שהוזנו ישירות בפרומפט. זה מאפשר לראות אם המודל באמת מסיק מסקנות מההקשר הנתון בזמן אמת.

איך טוענים

הקובץ המרכזי מגיע בפורמט JSONL פשוט שנקרא CL-bench.jsonl, ואין צורך לבקש הרשאות מיוחדות כדי להוריד אותו מהמאגר. כדי לעבוד איתו פשוט קוראים שורה אחר שורה ומחלצים את שדה messages להרצה ואת rubrics כדי למדוד את התוצאות מול הדרישות. מומלץ להציץ גם בקוד שבמאגר הגיטהאב של Tencent Hunyuan כדי לראות את סקריפטי ההרצה המקוריים.

from datasets import load_dataset

ds = load_dataset("tencent/CL-bench")

הרישיון

הרישיון כאן מותאם אישית ומוגבל אך ורק להערכה, בדיקות ובנצ'מרק. אסור בתכלית האיסור לאמן עליו, לבצע איתו כוונון עדין, זיקוק או כל עדכון משקלים אחר למודל שלכם. הוא נועד למדידה בלבד, כך שלא תוכלו להשתמש בו ישירות ליצירת דאטהסט מסחרי לאימון.

הרישיון המלא ב־Hugging Face ↗