GPT
A

airoboros-3.1

קוד פתוח

jondurbincc-by-4.02023-10-10

מאגר שיחות שנועד לאימון מודלים על משימות מורכבות, כולל פתרון בעיות מתמטיות בעזרת קוד חיצוני. הוא מיועד למי שרוצה שהמודל שלו יידע לעבוד עם הנחיות בכמה שלבים ולשמור על הקשר.

  • 430הורדות בחודש
  • 55לייקים

מה זה

המאגר מכיל שיחות מרובות תורות בפורמט ShareGPT, שנבנו כהמשך ישיר לסדרת airoboros. הדגש המרכזי כאן הוא שילוב של פתרונות מתמטיים מובנים: במקום לתת למודל לחשב בעצמו פעולות שבהן הוא נוטה לטעות, הוא מונחה להחזיר ייצוג בפורמט MathJSON בין תגיות ייעודיות, שאותו אפשר לחלץ ולהריץ במנוע חישוב דטרמיניסטי. חלק מנתוני המתמטיקה הותאמו מתוך הדאטהסט MetaMathQA, והחלק הזה כולל כ־17 אלף פריטים, מתוכם כ־4,000 כהוכחת היתכנות לקטגוריה הזו.

מעבר למתמטיקה, הדאטהסט כולל משימות חילוץ מידע מיומני מערכת (logs), ניקוי פרטים מזהים כמו שמות, כתובות IP ותאריכים מטקסט, והנחיות מרובות שלבים שדורשות אישור. בנוסף, משולבות בו שיחות שבהן מוזרקות שאלות אקראיות על תיאור הדמות, הרקע או דברים שנאמרו קודם, כדי להכריח את המודל להתייחס להנחיית המערכת ולהיסטוריית השיחה.

מתאים ל

  • אימון לחישובים מבוססי קוד

    לימוד מודלים לתרגם שאלות מתמטיות למבנה MathJSON, כדי שמנוע חיצוני יבצע את הפעולה במקומם.

  • שמירה על הקשר בשיחה

    אימון על שיחות שבודקות אם המודל עוקב אחרי היסטוריית השיחה והנחיות המערכת לאורך זמן.

  • אנונימיזציה וחילוץ מידע

    התאמת מודל למשימות של הסרת כתובות רשת, שמות ותאריכים מטקסט, וחילוץ נתונים מקובצי לוג.

איפה זה נופל

הכרטיס מציג סתירה במספרים לגבי רכיב המתמטיקה, כאשר בחלק אחד מצוין שיש בערך 17 אלף פריטים ובחלק אחר נכתב שיש כ־4,000 דוגמאות בלבד כהוכחת היתכנות. היוצר עצמו מודה שהוא לא בטוח עד כמה החלק של הנחיות מרובות שלבים עם אישור באמת שימושי. אין שום תיעוד על תמיכה בשפות שאינן אנגלית, אין פירוט על איך שאר הנתונים נוצרו או סוננו, והקוד שנמסר לחישוב הפתרונות מוגדר על ידי המפתח כפתרון מוגבל ולא יציב.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, רישיון cc-by-4.0 מאפשר שימוש מסחרי מלא. התנאי היחיד הוא לתת קרדיט ליוצר המאגר.

האם יש בדאטהסט תמיכה בעברית?

בתיעוד של המאגר אין שום אזכור לעברית, וכל הדוגמאות מופיעות באנגלית בלבד. אם המטרה היא אימון בעברית, הנתונים האלה לא מתאימים ללא תרגום.

באיזה פורמט שמורים הנתונים?

הנתונים מוגשים בקובץ conversations.json בפורמט ShareGPT. הפורמט הזה מותאם ישירות לספריות אימון וכוונון עדין פופולריות של מודלי שפה בקוד פתוח.

איך המאגר פותר את בעיית החישובים במודלי שפה?

במקום שהמודל ינסה לנחש תוצאות של פעולות מורכבות, הוא לומד לייצר ייצוג של הנוסחה בתוך תגיות mathjson. לאחר מכן מחלצים את התוכן ומחשבים את התוצאה עם ספרייה דטרמיניסטית חיצונית.

איך טוענים

הקובץ המרכזי במאגר הוא conversations.json, שמסודר במבנה ShareGPT הנתמך ישירות בכלי כוונון עדין בקוד פתוח. אין צורך באישור גישה כדי להוריד אותו, והוא זמין ישירות מהמאגר של jondurbin שמכיל שלושה קבצים בסך הכל. שדות השיחה מציגים את חילופי הדברים, וכדי להשתמש ביכולות החישוב צריך לתפוס את התוכן שבין תגיות mathjson ולהעביר אותו למפענח חיצוני מתאים.

from datasets import load_dataset

ds = load_dataset("jondurbin/airoboros-3.1")

הרישיון

הרישיון המדווח הוא cc-by-4.0. המשמעות היא שאתם רשאים להשתמש בנתונים לכל מטרה, כולל אימון מודלים מסחריים, שינוי הנתונים והפצתם. התנאי היחיד הוא מתן קרדיט מתאים ליוצר, jondurbin, וציון הרישיון המקורי. אין דרישה לשתף את המודל המאומן תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗