GPT
X

XYZ-Aquila-SFT

קוד פתוח

XYZAILabapache-2.02026-07-22

  • agent
  • tool-use
  • multi-turn
  • supervised-fine-tuning
  • web-search

המאגר מרכז 7,000 מסלולי שיחה ללימוד מודלים איך לחפש ברשת ולהפעיל כלים. הוא מתאים למי שרוצה לכוונן סוכן חכם דו-לשוני באנגלית ובסינית בלי לייצר דאטה סינתטי מאפס.

  • 1,088הורדות בחודש
  • 371לייקים

מה זה

הנתונים מחולקים לשני קבצי JSONL נפרדים לפי שפה, ללא קובץ מאוחד. החלק האנגלי מכיל 5,000 דוגמאות, והחלק הסיני כולל 2,000 דוגמאות, שתיהן תחת חלוקת train בלבד. המאגר הוא מדגם מתוך סט נתונים רחב יותר ששימש לאימון המודלים Aquila mini ו־Aquila pro, וחלק קטן מתוכן השאלות והתשובות נלקח מהמאגר PolarSeeker/OpenSeeker-v1-Data.

כל רשומה מציגה שאלה, תשובה סופית, ספירה של כמות הקריאות לכלים, ומערך שיחה שלם. השיחות מכילות הודעות מערכת, פניות משתמש, מחשבות של המודל ותוצאות של הפעלת כלים. הגדרות הכלים מוטמעות ישירות בהודעת המערכת הראשונה בפורמט התואם ל־Qwen3, וכוללות חיפוש ברשת, חילוץ מידע מדפים והרצת קוד פייתון.

מתאים ל

  • אימון סוכני חיפוש

    כוונון מודלים לביצוע חיפושים ברשת, עיבוד תוצאות וחילוץ מידע באנגלית ובסינית.

  • לימוד הפעלת כלים

    אימון על מסלולי שיחה מרובי שלבים שכוללים קריאה לפונקציות והרצת קוד פייתון.

  • ניתוח התנהגות סוכנים

    מחקר והשוואה של אופן קבלת ההחלטות ותהליכי ההסקה בתוך מסלולי שיחה מורכבים.

איפה זה נופל

הנתונים מוגבלים לחלוטין לאנגלית ולסינית, כך שאימון ישיר עליהם לא יתרום לפעולות חיפוש בעברית. המידע שמגיע מתוצאות החיפוש עלול להתיישן, להיות חלקי או לא להתאים למקורות עדכניים ברשת. בנוסף, המבנה מותאם לתבניות של Qwen3 ולשלושה כלים ספציפיים, ולכן שימוש בסביבות עבודה אחרות ידרוש התאמות מבניות. הדאטהסט לא מיועד לשמש כמבחן ביצועים עצמאי ואינו מבטיח אמינות עובדתית במוצר סופי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא Apache 2.0 והוא מתיר שימוש מסחרי מלא. אתם נדרשים לשמור על תנאי הרישיון המקוריים של המאגר ועל תנאי רישיון MIT של הדאטה החלקי שנלקח מ־OpenSeeker. האחריות על המידע שנאסף בתוצאות החיפוש החיצוניות נשארת אצלכם.

האם המאגר כולל נתונים בעברית?

לא. המאגר מציע שתי תצורות בלבד: 5,000 דוגמאות באנגלית ו־2,000 דוגמאות בסינית. כדי לבנות סוכן שמחפש בעברית תצטרכו לתרגם את המסלולים או להוסיף נתונים ייעודיים.

איך נאסף המידע בדאטהסט?

הדוגמאות הן מדגם שנלקח מתוך סט הנתונים ששימש לאימון מודלי Aquila של XYZAILab. המידע מתעד אינטראקציות אמיתיות או מסונתזות של סוכנים מול כלי חיפוש ופייתון, וחלק קטן מהשאלות והתשובות מגיע מהמאגר OpenSeeker-v1-Data.

איך משלבים את הכלים בתבנית שיחה קיימת?

הנתונים כוללים את סכמות הכלים בתוך הודעת המערכת הראשונה לפי תבנית Qwen3. אם הצינור שלכם דורש שדה tools נפרד, מריצים את הקובץ convert_tools.py עם פקודת extract כדי להפריד את הגדרות הכלים מהטקסט הרגיל.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets עם ציון שם המאגר והשפה הרצויה, en או zh, ואין צורך לבקש אישור גישה מראש. המאגר כולל חמישה קבצים, והשיחות נשמרות כמערך הודעות בתוך שדה trajectory לצד שדות המשאלה והתשובה. אם עובדים עם תבנית שיחה שלא מצפה לסכמות כלים מובנות בטקסט המערכת, מריצים את הסקריפט convert_tools.py במצב extract כדי לחלץ את הכלים למבנה נפרד ולמנוע כפילויות.

from datasets import load_dataset

ds = load_dataset("XYZAILab/XYZ-Aquila-SFT")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0, שמאפשר שימוש מסחרי, שינוי והפצה, כל עוד שומרים על הודעות זכויות היוצרים והרישיון המקוריות. מודל שתאמנו על הנתונים אינו מחויב ברישיון פתוח זהה. עם זאת, חלק קטן מהתוכן מבוסס על מאגר ברישיון MIT, והאחריות על עמידה בתנאי השימוש של מקורות המידע החיצוניים בחיפושים חלה עליכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗