GPT
T

TaskCraft

קוד פתוח

PersonalAILabmit2025-06-18

  • synthetic

מאגר של מעל 40 אלף משימות שמיועד לאימון סוכנים על הפעלת כלים והסקה מרובת שלבים. תקבלו כאן פירוק מובנה של פעולות מורכבות יחד עם עקבות ביצוע אמיתיים של סוכנים מול מודלים רגילים.

  • 25,219הורדות בחודש
  • 21לייקים

מה זה

המאגר מכיל דוגמאות משימה שמחולקות לרמות קושי שונות, מצעד בודד ועד ארבעה צעדים ומעלה. הנתונים מתרכזים בשלושה סוגי כלים עיקריים, ניתוח קובצי PDF, עיבוד דפי אינטרנט בפורמט HTML, וניתוח תמונות. המידע מגיע ממעבדת הבינה המלאכותית של חברת OPPO, ומלווה במאמר אקדמי שמפרט את שיטות היצירה והסינון של המשימות.

התוכן מחולק לשלושה קבצים מרכזיים בפורמט JSONL. הקובץ הראשון מרכז שאלות ותשובות נקיות עם שיוך לתחום הידע ולכלים הנדרשים. הקובץ השני מציג עקבות פעולה של משימות אטומיות, כולל השוואה בין תשובת מודל רגיל לתשובת סוכן שמפעיל כלים, לצד ציון ביצוע ומספר הקריאות לכלים. הקובץ השלישי מפרק משימות מרובות שלבים למשימות משנה, ומציג באופן שיטתי את שרשרת ההסקה מצעד הבסיס ועד היעד הסופי.

מתאים ל

  • אימון סוכנים לקריאת כלים

    כוונון מודלים על דפוסי קריאה נכונים לכלי PDF, HTML ותמונות לפי עקבות הביצוע שבמאגר.

  • הערכת פירוק משימות

    בדיקת היכולת של מודל לפרק שאלה מורכבת לרצף של צעדים קטנים בעזרת דוגמאות מרובות שלבים.

  • השוואת סוכן מול LLM

    מדידת הפער בין מענה ישיר של מודל שפה לבין ביצוע שנעזר בכלים חיצוניים לפי ציוני המאגר.

איפה זה נופל

המאגר מוגבל לשפות אנגלית וסינית בלבד, בלי שום ייצוג לעברית. אם המודל שלכם אמור לפעול בסביבה מקומית, תצטרכו לתרגם את המשימות או לבנות דאטה דומה בעצמכם. בנוסף, חלוקת הכלים מוגבלת לשלושה תחומים טכניים ספציפיים למסמכים, אתרים ותמונות, כך שאין כאן כיסוי לכלים כמו מסדי נתונים, הרצת קוד או ממשקי API מגוונים. כדאי לבדוק בעין חלק מהמשימות לפני שמאמנים עליהן, כי עקבות ביצוע אוטומטיים נוטים לפעמים להכיל שלבי ביניים מיותרים או קיבעונות של מודל המקור.

שאלות
נפוצות

האם המאגר כולל תוכן בעברית?

לא. הנתונים זמינים באנגלית ובסינית בלבד. אם אתם מפתחים מוצר לשוק הישראלי, תצטרכו לתרגם את השאילתות או להשתמש בו לאימון יכולות ההסקה הכלליות של המודל בלי תלות בשפה.

מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן. הרישיון שמצורף הוא רישיון MIT, שמאפשר שימוש מסחרי חופשי, שינוי של הנתונים ושילוב שלהם במוצרים סגורים. הדרישה היחידה היא לצרף את תנאי הרישיון המקוריים.

מה ההבדל בין שלושת הקבצים המרכזיים?

קובץ pure_qa כולל רק את השאלות, התשובות הסופיות והכלים הדרושים. קובץ atomic_trace מוסיף עקבות ריצה מלאים של סוכנים וציונים מול LLM רגיל. קובץ multihop מפרק את המשימות הארוכות לרצף מסודר של תת משימות.

האם צריך מחשב חזק כדי להוריד ולפתוח את המידע?

המאגר כולל מעל 40 אלף רשומות בחמישה קבצים טקסטואליים. אפשר לטעון ולעבד אותו בקלות על כל מחשב פיתוח רגיל בלי צורך בחומרת שרתים כבדה או בנפח אחסון חריג.

איך טוענים

אין צורך לבקש אישור גישה מיוחד, המאגר פתוח להורדה ישירה דרך Hugging Face או גיטהאב. הנתונים מגיעים בקובצי JSONL פשוטים לקריאה בכל שפת תכנות. בריצת עיבוד כדאי לשים לב לשדות query ו־golden_answer שקיימים בכל החלקים, ולבדוק בקובץ atomic_trace את השדות tool_calls_count ו־ans_from_agent שמכילים את היסטוריית הפעולות של הסוכן. אם אתם עובדים על פירוק משימות, המבנה בקובץ multihop מסודר כך שאינדקסים זוגיים מייצגים משימות אטומיות ואינדקסים אי זוגיים מציגים את המשימה המורחבת.

from datasets import load_dataset

ds = load_dataset("PersonalAILab/TaskCraft")

הרישיון

המאגר משוחרר תחת רישיון MIT. המשמעות פשוטה, מותר להשתמש בו לצרכים מחקריים ולמוצרים מסחריים בלי לשלם ובלי להגביל את אופי השימוש. אתם לא מחויבים לשחרר מודלים שתאמנו תחת אותו רישיון. התנאי היחיד הוא שמירת הודעת זכויות היוצרים וכתב הוויתור על האחריות של המפתחים המקוריים בכל עותק של הקוד או הנתונים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗