GPT
U

UltraInteract_pair

קוד פתוח

openbmbmit2024-04-02

המאגר מרכז זוגות העדפה למשימות חשיבה מורכבות ופתרון בעיות חישוביות. הוא נועד למי שרוצה לאמן מודל למידת העדפות על תהליכי הסקה שלמים ולא רק על תשובות קצרות.

  • 1,884הורדות בחודש
  • 111לייקים

מה זה

הנתונים בנויים סביב עצי העדפה לכל הוראה, כאשר המטרה היא להציג תהליכי חשיבה מורכבים בפורמט אחיד. בכל רשומה מופיעים מסלולי אינטראקציה שכוללים שרשראות חשיבה צעד אחר צעד, משוב ביקורתי טקסטואלי, ותוצאות של פעולות מול סביבה חישובית. המבנה מאפשר להשוות בין פעולות נכונות לפעולות שגויות באותה נקודת החלטה.

בסך הכל המאגר כולל 86 אלף הוראות מקוריות, שמתוכן נוצרו 286 אלף תשובות נכונות ו־219 אלף זוגות מועדפים של chosen ו־rejected. הזוגות מייצגים לא רק תוצאה סופית, אלא את המסלול כולו או צעדים מתוכו שבהם המודל תיקן את עצמו או כשל בדרך.

מתאים ל

  • אימון מודלי DPO ו־RLHF

    אימון מודלים של למידת העדפות על משימות הסקה הדורשות בחירה בין פתרון נכון לשגוי.

  • שיפור כתיבת קוד מתמטי

    כוונון יכולת פתרון בעיות באמצעות סימולציה וקוד פייתון צעד אחר צעד.

  • ביקורת על תהליכי חשיבה

    אימון מערכות לזהות טעויות חישוב מוקדמות בתוך שרשרת הסקה ארוכה.

איפה זה נופל

כל הדוגמאות במאגר כתובות באנגלית בלבד וכוללות פקודות קוד באנגלית. מי שמחפש לפתור בעיות בניסוח עברי או לאמן מודל שפה מקומי לא ימצא כאן תועלת ישירה. בנוסף, הנתונים מתמקדים בלוגיקה חישובית מובנית ובמתמטיקה, ולכן הם לא משקפים שיחות פתוחות, כתיבה יוצרת או הבנת שפה כללית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא MIT. הוא מאפשר שימוש חופשי לחלוטין לכל מטרה, כולל מסחרית. התנאי היחיד הוא שמירת הצהרת הרישיון והקרדיט למפתחים המקוריים.

האם יש במאגר נתונים בעברית?

לא, המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד. כל שרשראות ההסקה, ההוראות והקוד מבוססים על אנגלית. לצורך עבודה בעברית תצטרכו לתרגם את הנתונים או להשתמש במקור אחר.

במה הוא שונה ממאגרי העדפה רגילים?

במקום להציג רק זוגות של שאלות ותשובות סופיות, הוא בנוי מעצי החלטה ומסלולי אינטראקציה. הדוגמאות מכילות תיקונים, ביקורת על שלבים קודמים והרצות קוד. זה מתאים ספציפית לבעיות חשיבה רב שלביות.

איך טוענים

הקובץ המרכזי שמכיל את הנתונים שמור בפורמט Parquet תחת השם 0000_pair.parquet, לצד קובצי תיעוד ותמונות. אין צורך באישור גישה מיוחד כדי להוריד אותו, והוא פתוח לשימוש ישיר. מבחינת מבנה השדות, תמצאו שם בעיקר את הפיצול בין chosen לבין rejected עבור כל צעד או מסלול הסקה, שכוללים קטעי קוד פייתון והסברים מתמטיים שלב אחר שלב. חשוב לוודא שהצינור שלכם יודע לפרסר בלוקים של קוד משולבים בטקסט לפני שמתחילים להזין את הדוגמאות לתהליך האימון.

from datasets import load_dataset

ds = load_dataset("openbmb/UltraInteract_pair")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון מתיר שימוש מסחרי ומחקרי חופשי, כולל שינוי, הפצה ואימון מודלים ללא מגבלות על התוצר, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗