GPT
A

Agent-FLAN

קוד פתוח

internlmapache-2.02024-03-20

  • agent

מאגר נתונים לכוונון מודלים לתפקידי סוכנים ושימוש בכלים, שנבנה על בסיס עיבוד מחדש של דאטהסטים קיימים. הוא מתאים למי שרוצה לאמן מודל קוד פתוח לפעולות סוכן ולהפחית הזיות בזמן הפעלת כלים.

  • 1,536הורדות בחודש
  • 106לייקים

מה זה

המאגר מכיל קובצי jsonl שמורכבים משילוב של שלושה מקורות עיקריים: AgentInstruct, ToolBench, ודוגמאות שליליות שנבנו במיוחד עבור הפרויקט, לצד נתוני שיחה ממאגר ShareGPT של סדרת Llama2-chat. המטרה מאחורי הבנייה הזו היא לפרק את המורכבות של למידת הפורמט מלמידת יכולות ההסקה של הסוכן, כדי לקרב את הנתונים להתפלגות של שלב האימון המקדים.

הקבצים במאגר מחולקים לפי סוגי משימות ועיבודים. אפשר למצוא שם קבצים מבוססי ReAct מתוך AgentInstruct ו־ToolBench, קבצים בפורמט ייעודי של הפרויקט הכוללים שרשראות מחשבה, קובץ של דוגמאות שליליות שמטרתן ללמד את המודל מתי לא לקרוא לכלי או להימנע מהזיות, וחלוקות באחוזים שונים לצורכי אימון מבוקר.

מתאים ל

  • אימון סוכנים לשימוש בכלים

    כוונון מודלי שפה לביצוע קריאות לכלים חיצוניים על בסיס דוגמאות ReAct ושרשראות מחשבה.

  • צמצום הזיות בסוכנים

    שימוש בקובץ הדוגמאות השליליות כדי ללמד את המודל להימנע מהפעלת כלים מיותרת או שגויה.

  • התאמת מודלים לשיחה מובנית

    אימון מודלים לפי פורמט השיחה הייעודי של Llama-2-chat לצורכי משימות מורכבות.

איפה זה נופל

הכרטיס מודה במפורש שהכנסת יכולות סוכן נוטה לייצר תופעות לוואי של הזיות, ולכן נבנו הדוגמאות השליליות. בנוסף, הנתונים מתבססים על מאגרי מקור כמו ToolBench ו־AgentInstruct שנוצרו באנגלית, ואין כאן שום אזכור לתמיכה בעברית. כל התבניות מקודדות לפי הפורמט של Llama-2-chat, כך שאם אתם מאמנים ארכיטקטורה אחרת, תצטרכו להמיר את הפורמטים ידנית כדי לא לדפוק את האימון.

שאלות
נפוצות

האם מותר להשתמש במאגר הזה לצרכים מסחריים?

הרישיון המוצהר של המאגר עצמו הוא Apache 2.0 שמאפשר שימוש מסחרי חופשי למדי, כולל ייחוס זכויות. עם זאת, המאגר מורכב מנתונים שמקורם בפרויקטים כמו ShareGPT, AgentInstruct ו־ToolBench. כדאי לבדוק את תנאי השימוש של מאגרי המקור לפני שאתם מתחייבים להשתמש בתוצרים במוצר מסחרי.

האם הדאטהסט כולל נתונים בעברית?

לא. המאגר מבוסס כולו על AgentInstruct, ToolBench ו־ShareGPT, שהם מאגרים באנגלית שמכוונים לקריאות API ופרומפטים באנגלית. לא הייתי בונה עליו לכוונון סוכן שאמור לתקשר או להפעיל כלים בשפה העברית בלי להוסיף דאטה מתורגם או מותאם מקומית.

במה הוא שונה משימוש ישיר ב־ToolBench או AgentInstruct?

החוקרים שפרסמו את המאגר טוענים שאימון ישיר על מאגרי סוכנים קיימים גורם להזיות ומערבב בין לימוד הפורמט לבין ההסקה הלוגית. המאגר הזה ארגן מחדש את הדוגמאות, פיצל אותן לתצורות שונות והוסיף דוגמאות שליליות ייעודיות כדי לפתור את הבעיות האלה.

איך טוענים

טוענים את הקבצים ישירות דרך ספריית datasets או בקריאת jsonl פשוטה בפייתון, ללא צורך באישור גישה מיוחד. המאגר כולל תשעה קבצים בפורמט טקסטואלי רגיל. בעבודה עם הנתונים האלה צריך לשים לב לתבנית השיחה, שכן הרשומות מותאמות לפרוטוקול המדויק של Llama-2-chat ומגדירות תפקידי user, system ו־assistant עם תוחמים ייחודיים לכל צד בשיחה.

from datasets import load_dataset

ds = load_dataset("internlm/Agent-FLAN")

הרישיון

הרישיון המדווח הוא apache-2.0, רישיון קוד פתוח מתירני מאוד. הוא מאפשר שימוש מסחרי, שינוי והפצה של הנתונים, בתנאי שאתם שומרים על הודעת זכויות היוצרים והרישיון המקורי. אין חובה לשתף את המודל המאומן תחת אותו הרישיון, אבל חובה לבדוק את תנאי השימוש של דאטהסטי המקור ששימשו להרכבת המאגר לפני שמשלבים אותו במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗