GPT
U

UltraData-SFT-Agent-2609

קוד פתוח

openbmbapache-2.02026-08-31

  • llm
  • sft
  • supervised-fine-tuning
  • post-training
  • agent

במאגר תמצאו כחצי מיליון מסלולי אימון מלאים להפעלת סוכנים וכלים חיצוניים. הוא נבנה עבור מודלים שצריכים ללמוד אינטראקציה מורכבת עם סביבות עבודה, כולל התאוששות משגיאות.

  • 642הורדות בחודש
  • 68לייקים

מה זה

המאגר מכיל 483,661 מסלולי ריצה מובנים שמיועדים לשלב התיאום של מודלי שפה. כל רשומה כוללת את הוראת המשתמש, קריאות הכלים, תשובות הסביבה, ניסיונות תיקון והתוצאה הסופית. הנתונים מתחלקים לארבע גזרות עיקריות: משימות סוכן כלליות עם 311,006 דוגמאות, שימוש בכלים וקריאות פונקציה עם 82,760 דוגמאות, סוכני קוד ותוכנה עם 69,895 דוגמאות, וסוכני חיפוש מרובי שלבים עם 20,000 דוגמאות.

המקורות מבוססים על מאגרים ציבוריים, קוד פתוח, תוכן רשת ומשימות שנכתבו ידנית. מודלי מורה הריצו את המשימות בסביבות אמיתיות ומדומות. לאחר מכן הופעלו סינונים אוטומטיים שבדקו תקינות תחבירית, הרצה בארגז חול, בדיקות נכונות של קבצים, סינון דליפות למבחני הערכה והסרת פרטים מזהים ומפתחות גישה.

מתאים ל

  • אימון סוכני קוד

    לימוד מודלים לבצע שינויים בתוכנה, לתקן באגים ולהריץ בדיקות בסביבות פיתוח שונות.

  • כוונון קריאות פונקציה

    אימון מודל לחלץ פרמטרים, להפעיל ממשקי API ולבצע שאילתות מול מסדי נתונים לפי סכמה.

  • התאוששות משגיאות כלי

    חשיפת מודלים למסלולים שבהם כלי נכשל או החזיר שגיאה, כדי שילמדו לנסות שוב בדרך אחרת.

איפה זה נופל

הנתונים קפואים בזמן וכוללים רק תיעוד סטטי של האינטראקציות, בלי סביבות ההרצה או קוד הכלים עצמם, כך שאי אפשר להריץ אותם מחדש. השפות מוגבלות לאנגלית ולסינית בלבד, ואין כאן עברית כלל.

חלק מהדוגמאות כוללות כשלים יזומים ושגיאות שנועדו לאמן התאוששות מתקלות ולא מדגימות הצלחה, ולכן אי אפשר להשתמש בהן בעיוורון. בנוסף, מעבר בדיקה בארגז החול אינו מבטיח שכל שלב בריצה היה יעיל, והרבה מהממשקים המוגדרים בדאטהסט הם וירטואליים ולא קיימים במציאות.

שאלות
נפוצות

האם המאגר מתאים לפרויקטים בעברית?

המאגר כולל רק דוגמאות באנגלית ובסינית, ולכן הוא לא מתאים ישירות למי שרוצה לאמן יכולות בעברית. אפשר להיעזר בו לחקר מבנה הקריאות לכלים, אבל תצטרכו לתרגם את הנתונים או לייצר דוגמאות מקומיות משלכם.

מותר להשתמש בנתונים כדי לאמן מוצר מסחרי?

הרישיון המוצהר הוא apache-2.0, אך היוצרים מציינים שהנתונים נאספו ממקורות מגוונים ברשת ומעמודי קורסים. תנאי המקורות הללו קודמים לרישיון הדאטהסט, כך שאי אפשר להסתמך על שימוש מסחרי חופשי בלי לבדוק את מקור הנתונים של כל תת-קבוצה.

איך הנתונים נאספו ונבדקו בפועל?

משימות גולמיות עברו הרחבה והופעלו על ידי מודלי מורה בסביבות ריצה אמיתיות ומדומות. התוצאות נבדקו בארגזי חול, בקובצי הרצה ובאמצעות בדיקות מודל, כדי לוודא שקריאות הכלים תקינות והתוצאה עונה על הדרישות.

האם אפשר להריץ את הכלים שמופיעים בדאטהסט?

לא, המאגר מספק רק את תיעוד הריצה ההיסטורי ולא כולל את קוד הכלים או את סביבות ההרצה. רוב ממשקי ה־API המוזכרים שם וירטואליים לחלוטין ושימשו רק לצורך הסימולציה.

איך טוענים

טוענים את המידע באמצעות ספריית datasets עם ציון אחת מארבע התצורות: Code-Agent, Search-Agent, General-Agent או Tool-Use. הנתונים מגיעים בקובצי JSONL המחולקים למספר חלקים.

השדות המרכזיים הם messages שמכיל את רצף השיחה, התצפיות וקריאות הכלים, וכן tools שמגדיר את הפונקציות שהיו זמינות למודל. את הגדרות הכלים צריך לשתול ישירות בתבנית השיחה בזמן האימון. אין צורך לבקש אישור גישה מראש כדי להוריד את הקבצים.

from datasets import load_dataset

ds = load_dataset("openbmb/UltraData-SFT-Agent-2609")

הרישיון

המאגר מוגדר תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה, ומודל שאומן עליו אינו מחויב ברישיון פתוח. יחד עם זאת, היוצרים מדגישים שחלק מהנתונים הגיעו ממקורות חיצוניים ומעמודי קורסים שחלים עליהם תנאי זכויות יוצרים מקוריים, ושחל איסור מפורש להפיץ מחדש או לארח עותק של המאגר בלי אישור מראש.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗