GPT
U

UltraInteract_sft

קוד פתוח

openbmbmit2024-04-02

מאגר לאימון מודלים על משימות חשיבה מורכבות, קידוד ומתמטיקה. הוא כולל שרשראות הסקה ואינטראקציה מרובת שלבים סביב 86 אלף הוראות שונות.

  • 1,495הורדות בחודש
  • 129לייקים

מה זה

המאגר מכיל נתונים שנועדו לכוונון עדין של מודלי שפה, ומבוסס על עצי העדפה שנבנו עבור 86 אלף הוראות. בכל עץ כזה, ההוראה משמשת כשורש וכל פעולה מייצגת צומת, כאשר מסלולים שמסתיימים בפעולות נכונות נלקחים לאימון. בסך הכל נכללות בו 286 אלף תשובות נכונות שמציגות פתרון שלב אחר שלב לצד שימוש בכלים ומשוב מהסביבה.

המבנה של הרשומות כולל משימות שונות כמו כתיבת קוד, פתרון בעיות מתמטיות ושאלות היגיון. בחלק מהרשומות יש שימוש מפורש בקריאות לפונקציות חיצוניות, כמו חיפוש בויקיפדיה עבור שאלות מתוך מאגרים קיימים כמו hotpotqa, לצד פתרונות בפייתון שמחשבים תוצאות ישירות.

מתאים ל

  • כוונון מודלים לקידוד

    אימון מודלים על פתרון צעד אחר צעד של בעיות תכנות בפייתון לפי הוראות מוגדרות.

  • אימון על שימוש בכלים

    לימוד מודל לשלב קריאות לפונקציות חיצוניות, כמו חיפוש טקסטואלי, לצורך מענה על שאלות.

  • פתרון בעיות במתמטיקה

    הטמעת יכולת כתיבת סקריפטים שמחשבים תשובות מתמטיות בצורה מובנית.

איפה זה נופל

כל הנתונים במאגר כתובים באנגלית בלבד, כך שהוא לא יעזור ישירות למי שמפתח מודל ייעודי לעברית. בנוסף, משימות ההיגיון והקוד נשענות על פורמטים קשיחים וקריאות מוגדרות לכלים, כך שהן עשויות להטות מודל לפעול רק בתבניות האלו במקום לפתח הסקה כללית גמישה. הכרטיס אינו מפרט את אופן הסינון של שאר המקורות או את רמת הדיוק של המשוב האוטומטי ששימש לבניית העצים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, הרישיון המדווח הוא רישיון MIT. הרישיון הזה מתיר שימוש מסחרי חופשי, עריכה והפצה. הדרישה היחידה היא לצרף את תנאי הרישיון והודעת זכויות היוצרים.

האם המאגר כולל דוגמאות בשפה העברית?

לא, המאגר מסומן כמאגר באנגלית בלבד. כל ההוראות, קטעי הקוד והחיפושים נכתבו באנגלית. לא תמצאו בו נתוני אימון בעברית.

מה ההבדל בין מאגר ה־SFT למאגר ה־pair באותו פרויקט?

מאגר ה־sft כולל רק מסלולים ותשובות שהוגדרו כנכונות מתוך עצי ההסקה, והוא נועד לכוונון ישיר של המודל. גרסת ה־pair מכילה זוגות של פעולות נכונות מול שגויות, ומיועדת לשלב של למידת העדפות כמו DPO או RLHF.

מאיפה הגיעו הנתונים שנמצאים בפנים?

הנתונים מבוססים על אינטראקציות סביב 86 אלף הוראות ממקורות שונים, ביניהם מאגרים קיימים כמו hotpotqa. מתוך ההוראות הללו נבנו מסלולי הסקה רב-שלביים שמשלבים כתיבת קוד, בדיקת סביבה ומשוב טקסטואלי.

איך טוענים

הנתונים מחולקים לקובצי parquet, כולל הקובץ 0000_sft.parquet, וזמינים להורדה ישירה דרך ספריית הדאטהסטים של Hugging Face ללא צורך בהרשאה מיוחדת. ברשומות מופיעים שדות זיהוי כמו id ו־parent_id כדי למקם את הפעולה בתוך עץ ההסקה, סוג המשימה בשדה task, שם המקור בשדה dataset, ותוכן הפנייה בשדה instruction שמכיל את הצעדים ואת קטעי הקוד.

from datasets import load_dataset

ds = load_dataset("openbmb/UltraInteract_sft")

הרישיון

המאגר מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים המקורית. הרישיון אינו כופה פתיחת קוד של מודלים שאומנו עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗