GPT
O

OpenO1-SFT

קוד פתוח

O1-OPENapache-2.02024-11-21

המאגר כולל עשרות אלפי דוגמאות אימון שנועדו להקנות למודלי שפה יכולת חשיבה מובנית בשלבים. הוא רלוונטי למי שרוצה לשפר ביצועים במשימות היגיון מורכבות.

  • 1,265הורדות בחודש
  • 388לייקים

מה זה

הנתונים כוללים 77,685 רשומות המיועדות לשלב ה־SFT כדי להפעיל יכולות של שרשרת מחשבה. הפורמט של שדה התשובה בכל רשומה מקפיד על הפרדה ברורה בין שלבי החשיבה לבין התוצאה הסופית, באמצעות התגיות Thought ו־Output. המבנה הזה מכריח את המודל לייצר רצף הנמקה מפורט ומסודר לפני שהוא פולט את התשובה שהוא הגיע אליה.

התוכן עצמו כתוב באנגלית ובסינית, ומבוסס על המאמר שמקשר בין הגדלת זמן הריצה בהסקה לבין הנדסת יכולות קוגניטיביות. כרטיס המאגר לא מפרט מאיזה מקורות ספציפיים הרשומות נאספו במקור, איך התבצע הסינון שלהן, או האם נעשה שימוש בסינתזה על ידי מודלים אחרים. אין כאן חלוקה מוגדרת מראש לחלקי אימון, בדיקה או ולידציה.

מתאים ל

  • אימון מודל לחשיבה שלב אחר שלב

    לימוד מודלים קטנים לפלוט שלבי הנמקה מלאים ומסודרים לפני שליפת תשובה.

  • שיפור ביצועים במשימות היגיון

    התאמת מודל שיחה לפתרון בעיות מורכבות באמצעות שרשרת מחשבה ייעודית.

  • מחקר על דגימת זמן הסקה

    בדיקת שיטות דגימה מרובות על מודל שאומן לחשוב כדי למדוד עקביות פנימית.

איפה זה נופל

המאגר מוגבל לשפות אנגלית וסינית בלבד, כך שאין בו תמיכה בעברית. שימוש בו לאימון ישיר עבור משימות בעברית ידרוש תרגום מסיבי או איסוף מקביל של דוגמאות חשיבה מקומיות.

החיסרון המרכזי בתיעוד הוא היעדר שקיפות לגבי מקור הדגימות והאופן שבו הן נבדקו. נתוני הבנצ'מרק שמצורפים מראים נפילה בציון בבדיקות בודדות כמו GSM8K ו־MATH ביחס למודל הבסיס, ורק דגימה מרובה משפרת את המצב. בנוסף, חוסר הידיעה על אופן יצירת הנתונים מחייב בדיקה מדגמית ידנית של שלבי ההסקה כדי לשלול שגיאות לוגיות שנלמדות במודל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון הוא apache-2.0 ומאפשר שימוש מסחרי ללא תשלום. תצטרכו רק לכלול את הצהרת הרישיון והקרדיט למחברים בהפצה שלכם.

האם יש בדאטהסט תמיכה בעברית?

לא, הנתונים כוללים אך ורק אנגלית וסינית. לא מופיע שם טקסט בעברית, ולכן לא הייתי משתמש בו ישירות למשימות מקומיות בלי התאמה ייעודית.

כמה רשומות יש במאגר ואיך לגשת אליהן?

המאגר מכיל בדיוק 77,685 רשומות שמרוכזות בקובץ JSONL יחיד. אין צורך באישור גישה כדי להוריד אותו ישירות מהעמוד.

איך בנוי שדה התשובה בכל רשומה?

כל תשובה מחולקת לשניים באמצעות תגיות טקסט ייעודיות. שלב החשיבה מופיע בתוך תגיות Thought, והתשובה המוגמרת מופיעה בתוך תגיות Output.

איך טוענים

הנתונים יושבים בקובץ בודד מסוג JSONL בשם OpenO1-SFT.jsonl, לצד קובץ התיעוד של המאגר. המאגר פתוח לחלוטין לגישה ישירה בחיבוק פנים ללא צורך בהרשמה מיוחדת או בקשת אישור מהיוצרים, וניתן לטעון אותו בעזרת ספריית datasets הרגילה של פייתון או בקריאה ישירה של קובץ השורות.

בעת העיבוד צריך לשים לב לשדה התשובה ולפרסר נכון את התגיות של החשיבה והפלט. אם אתם מתכננים אימון עם טוקנייזר ייעודי או תבנית שיחה קבועה, תצטרכו לוודא שהתגיות האלו לא מתנגשות עם הטוקנים המיוחדים של המודל שלכם.

from datasets import load_dataset

ds = load_dataset("O1-OPEN/OpenO1-SFT")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הנתונים, ושילוב שלהם בפיתוח פנימי או במוצרים חיצוניים. הוא לא מחייב שיתוף של הקוד או של המודלים המאומנים תחת אותו רישיון, אך מחייב מתן קרדיט ושמירה על הודעות זכויות היוצרים המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗