GPT
A

agent-sft

קוד פתוח

nex-agiodc-by2025-11-18

  • agentic-models
  • tool-use
  • code-generation
  • instruction-tuning

מאגר לאימון סוכנים אוטונומיים שמכיל שיחות מובנות לקריאת כלים וכתיבת קוד. הוא מיועד למי שרוצה ללמד מודל שפה לפעול בעולם ולא רק לפלוט טקסט.

  • 480הורדות בחודש
  • 120לייקים

מה זה

המאגר כולל 69,008 רשומות שמיועדות לכוונון עדין של מודלים. הנתונים מחולקים למספר קבצים לפי תחומי משימה: מעל 24 אלף דוגמאות לקוד סוכני, כמעט 12 אלף דוגמאות של התנהגות סוכן כללית, כעשרת אלפים דוגמאות לקריאות כלים, כ־8,300 משימות הקשורות ל־HTML, ומעט יותר מאלפיים שיחות צ'אט רגילות. ישנם במאגר שמונה קבצים בסך הכל, ובהם גם קובצי deep_research ו־html לצד קובץ הסבר.

לפי הכרטיס, הצוות בחר מחדש שאילתות מתוך סט האימון הרחב של NEX-N1, ולאחר מכן ייצר את התשובות מחדש באמצעות המודל DeepSeek-V3.1-Nex-N1. כל רשומה בנויה בפורמט שיחה שכולל הוראת מערכת, פניות משתמש, תגובות של המודל ותוצאות שהוחזרו מכלים. בנוסף, כל דוגמה מחזיקה מזהה ייחודי, הגדרות סכמה מפורטות של הכלים הזמינים עם פרמטרים, ושם המודל שייצר את הפלט.

מתאים ל

  • אימון לקריאת כלים

    לימוד מודל שפה לפרסר כוונות משתמש ולהחזיר קריאות לפונקציות חיצוניות עם פרמטרים מדויקים לפי סכמה מוגדרת.

  • בניית סוכן לפיתוח תוכנה

    שימוש בעשרות אלפי דוגמאות הקוד הסוכני כדי לאמן מודל לפתור משימות תכנות אינטראקטיביות מורכבות.

  • אימון סוכני מחקר עצמאיים

    כוונון המודל על דוגמאות מחקר כדי שיבצע סדרת פעולות של איסוף מידע, שימוש בכלים ועיבוד מסקנות.

איפה זה נופל

הנתונים כולם נוצרו בצורה סינתטית על ידי מודל שפה יחיד, מה שאומר שהטיות, הזיות וטעויות היגיון של DeepSeek נכנסו ישירות לתוך התשובות. המאגר מוגבל לשפות אנגלית וסינית בלבד, כך שאין כאן שום תמיכה בעברית, לא בשאילתות ולא בתיאורי הכלים. כדאי גם לבדוק את התחביר של קריאות הכלים וה־HTML לפני שדוחפים את זה לאימון, כי המפרסמים לא מפרטים תהליך של סינון או ולידציה ידנית על הפלטים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, רישיון ODC-By מאפשר שימוש מסחרי מלא בנתונים. הדרישה העיקרית היא מתן קרדיט וייחוס מתאים ליוצרי המאגר nex-agi. אין דרישה לפתוח את המודל שתאמנו או לשתף את השינויים שתבצעו.

האם המאגר מתאים לאימון סוכנים שפועלים בעברית?

לא. הנתונים מתועדים כשפות אנגלית וסינית בלבד. כל השאילתות, התשובות והגדרות הכלים כתובות בשפות אלו, ולכן שימוש בו לא יעזור למודל להבין פניות או להפעיל כלים בעברית.

מאיפה הגיעו הנתונים שבתוך המאגר?

השאילתות נבחרו מתוך סט האימון של NEX-N1. התשובות והאינטראקציות עצמן נוצרו באופן סינתטי מחדש באמצעות מודל DeepSeek-V3.1-Nex-N1, ולא מדובר באינטראקציות של בני אדם.

האם יש צורך לבקש אישור מיוחד כדי להוריד את הקבצים?

לא נדרש שום אישור מוקדם והגישה חופשית לגמרי. המאגר מכיל 8 קבצים, רובם קובצי JSONL המחולקים לפי נושאים, וניתן להוריד אותם ישירות מהרשת.

איך טוענים

הנתונים יושבים בקובצי JSONL פתוחים להורדה ישירה ללא צורך באישור גישה מיוחד. אפשר למשוך אותם ישירות דרך ספריית הדאטהסטים הרגילה של פייתון או להוריד את הקבצים הבודדים לפי הצורך שלכם, כמו tool_calling.jsonl או agentic_coding.jsonl. בעבודה מול הרשומות, השדות שמעניינים אתכם הם messages שמכיל את רצף האינטראקציה, ו־tools שמגדיר את הפונקציות שהמודל אמור להפעיל.

from datasets import load_dataset

ds = load_dataset("nex-agi/agent-sft")

הרישיון

המאגר מפורסם תחת רישיון ODC-By. מותר להשתמש בנתונים למטרות מסחריות, לשנות אותם ולשלב אותם במאגרים אחרים, בתנאי שנותנים קרדיט מתאים ליוצרים. אין כאן חובת שיתוף זהה, כך שאתם לא מחויבים לשחרר את המודל המאומן או שינויים שתעשו תחת אותו רישיון.

הרישיון המלא ב־Hugging Face ↗