GPT
D

draco

קוד פתוח

perplexity-aimit2026-02-04

  • deep-research

זהו בנצ'מרק להערכת סוכני מחקר מורכבים, הכולל רובריקות בדיקה מפורטות שנכתבו בידי מומחים עבור שאילתות קשות מהעולם האמיתי.

  • 1,823הורדות בחודש
  • 112לייקים

מה זה

המאגר מורכב מ־100 שאילתות מחקר פתוחות ומורכבות שמקורן במשתמשי Perplexity Deep Research מספטמבר ואוקטובר 2025. הצוות בחר במכוון מקרים שבהם המשתמשים לא היו מרוצים מהתשובות הראשוניות של המודל, ניסח אותם מחדש, הסיר פרטים מזהים והוסיף אילוצים כמו פרסונה, פורמט פלט והיקף גאוגרפי.

לכל שאילתה מוצמדת רובריקת הערכה ייעודית שנבנתה ונבדקה על ידי 26 מומחים בתחומים שונים. המשימות מחולקות לעשרה תחומים שונים, כשהבולטים שבהם הם פיננסים עם עשרים אחוז והשוואת מוצרים עם שישה עשר אחוז, לצד אקדמיה, טכנולוגיה, רפואה ומשפט. כל רובריקה מחזיקה כארבעים קריטריונים בממוצע על פני ארבעה צירים: דיוק עובדתי, עומק ורוחב הניתוח, איכות ההצגה ואיכות הציטוטים.

מתאים ל

  • הערכת סוכני מחקר

    בדיקת ביצועים של מערכות אוטונומיות שמבצעות חיפוש ברשת, מיזוג מקורות והפקת דוחות מעמיקים.

  • כיול שופטי הערכה

    שימוש ברובריקות המפורטות להרצת פרוטוקול בדיקה של מודל שפה שמעניק ציונים לתשובות ארוכות.

  • בדיקת עמידות לשגיאות קריטיות

    מדידת יכולת המערכת להימנע משגיאות מסוכנות באמצעות משקלים שליליים שנקבעו לקריטריונים מטעים.

איפה זה נופל

זהו מבחן סטטי שמשקף את סוף שנת 2025 ומבוסס על אנגלית בלבד. אין כאן כיסוי לשפות אחרות או לרגולציה מקומית מחוץ להגדרות המשימה. עשרת התחומים לא מכסים כל צורך מחקרי, וההערכה נשענת על שופט מבוסס מודל שפה, מה שמייצר שונות בציונים המוחלטים אם מחליפים את המודל הבודק. בנוסף, המאגר כולל 100 דוגמאות בלבד, כך שהוא מתאים להערכה וולידציה ולא לאימון רחב היקף.

שאלות
נפוצות

האם אפשר להשתמש בדאטהסט הזה לאימון מודלים?

טכנית רישיון MIT מרשה זאת לחלוטין. בפועל המאגר כולל 100 רשומות בלבד בתוך קובץ בדיקה, כך שהוא מיועד להערכה ולא לדאטהסט אימון.

האם הנתונים כוללים מידע בעברית?

לא. השאילתות, הרובריקות ומקורות המידע מוגדרים באנגלית בלבד, אם כי המשימות נוגעות במקורות מ־40 מדינות שונות.

איך מחשבים את הציון לפי הרובריקה?

הציון מחושב באמצעות סכימת משקלי הקריטריונים שהתקבלו. קריטריונים חיוביים מעלים את הציון, ואילו קריטריונים שליליים, למשל שגיאה רפואית, מפחיתים ממנו באופן משמעותי.

איך טוענים

הכול יושב בקובץ יחיד בשם test.jsonl ללא צורך בהרשאות מיוחדות. פורקים שורה, ומקבלים שדות בסיסיים כמו id, domain והשאילתה המלאה בשדה problem. שימו לב לשדה answer, הוא אינו טקסט תשובה רגיל אלא מחרוזת JSON פנימית שמכילה את עץ הקריטריונים, המשקלים וההגדרות הדרושות למודל השופט שלכם.

from datasets import load_dataset

ds = load_dataset("perplexity-ai/draco")

הרישיון

המאגר מפורסם תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לשלב אותו במערכות פנימיות ולהפיץ אותו, כל עוד שומרים על הודעת הרישיון וזכויות היוצרים המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗