GPT
S

Step-3.5-Flash-SFT

קוד פתוח

stepfun-aiapache-2.0,cc-by-nc-2.02026-03-14

  • chat
  • sft
  • instruction-tuning
  • reasoning
  • code

מאגר שיחות כללי לאימון מודלי צ'אט עם שלבי חשיבה מובנים. הוא מגיע מוכן לריצה מהירה לצד קבצי מקור גולמיים וטוקנייזרים מותאמים.

  • 5,654הורדות בחודש
  • 347לייקים

מה זה

הנתונים מיועדים לאימון מסוג SFT ומאורגנים במבנה שיחה מסודר של תורות בין משתמש לעוזר. כל רשומה כוללת תפקיד, תוכן גלוי, שדה מסכת הפסד שמגדיר על אילו תורות מחשבים גרדיאנטים, ומטא-דאטה. בחלק מתורות העוזר מופיע שדה ייעודי של תוכן חשיבה לצד התשובה הסופית, מה שמאפשר לאמן מודלים להפיק תהליכי היסק לפני הפלט.

המבנה במאגר מפוצל לשלושה חלקים. התיקייה הראשונה מחזיקה קבצי ג'ייסון גולמיים ומייצגת את מקור המידע האמיתי. התיקייה השנייה מכילה תצלומי טוקנייזרים עבור המודלים Step-3.5-Flash ו־Qwen3 כדי לשמור על תבנית שיחה מדויקת. התיקייה השלישית מציעה שארדים מקומפלים בפורמט בינארי שנתפרו במיוחד להאצת ריצות אימון. הכרטיס אינו מפרט מה מקור הטקסטים בעולם או אילו סינונים הופעלו עליהם.

מתאים ל

  • אימון צ'אט עם שלבי חשיבה

    כוונון מודלי שיחה מחקריים שלומדים לייצר תהליך חשיבה מובנה לפני התשובה הסופית.

  • שחזור ניסויי StepTronOSS

    הרצת אימוני SFT ישירות על השארדים הבינאריים המוכנים בהתאם למתכוני המחקר הרשמיים.

  • מחקר על פיקוח לפי תורות

    ניתוח השפעת שדה מסכת ההפסד על אופן הלמידה של מודלי שפה בשיחות מרובות שלבים.

איפה זה נופל

התיעוד שותק לחלוטין לגבי מקורות המידע, תאריכי הדגימה, אופן הסינון וההרכב הלשוני בפועל מעבר להגדרה רב-לשוני. המשמעות היא שאין דרך לדעת מה טיב העברית כאן בלי לדגום ידנית את קבצי המקור לפני שמתחילים תהליך יקר.

השארדים המקומפלים אינם פורמט גנרי. הם נבנו ספציפית עבור שלד האימון StepTronOSS ונעולים לגרסאות הטוקנייזרים שצורפו. מי שעובד בתשתית אחרת יצטרך לקחת את קבצי הג'ייסון ולעבד אותם מאפס, כולל החלטה מה לעשות עם שדות החשיבה.

שאלות
נפוצות

האם מותר להשתמש במאגר לאימון מודל לחברה מסחרית?

לא. הדאטהסט מחייב עמידה בו זמנית בתנאי Apache-2.0 ובתנאי CC-BY-NC-2.0. הסעיף הלא מסחרי אוסר כל שימוש למטרות רווח.

האם יש בדאטהסט תמיכה בעברית?

המאגר מוגדר כמולטילינגואלי, אך הכרטיס לא מציין אילו שפות קיימות בפועל או מה חלקן במידע. אם אתם בונים על עברית, חובה להוריד כמה שארדים של ג'ייסון ולבדוק לפני שמתחילים.

האם חייבים להשתמש בשלד האימון StepTronOSS?

לא, אפשר לטעון את קבצי הג'ייסון הגולמיים מתיקיית json בכל ספרייה רגילה. הקבצים המקומפלים בתיקיית compiled כן דורשים את StepTronOSS ואינם מתאימים לספריות אחרות.

איך נאספו הנתונים?

היוצרים לא פרסמו פרטים על מקור הטקסטים, על אופן הסינון או על תהליך הבקרה. הדבר היחיד שמתועד הוא מבנה השדות בשיחה והמתכון הטכני לאימון.

איך טוענים

טעינה בסיסית נעשית בספריית datasets על קבצי הג'ייסון בנתיב היחסי באמצעות טעינת קבצי json. המאגר מכיל 954 קבצים ואינו דורש אישור גישה מוקדם.

אם מאמנים ב־StepTronOSS, עובדים ישירות מול השארדים המקומפלים בנתיב הבינארי ומצביעים על תיקיית הטוקנייזר התואמת, תוך הקפדה על סמפלר רציף בלי ערבוב וגרסת transformers נמוכה מחמש.

from datasets import load_dataset

ds = load_dataset("stepfun-ai/Step-3.5-Flash-SFT")

הרישיון

המאגר מפורסם תחת שילוב כפול של Apache-2.0 יחד עם CC-BY-NC-2.0. המפרסמים מדגישים שחובה לציית לשני הרישיונות יחד ולא לבחור ביניהם. הסעיף הלא מסחרי של CC קובע כאן את הגבול העליון, ולכן אסור להשתמש בנתונים האלה לאימון מודל מסחרי או למוצר מניב רווח. שימוש למחקר לא מסחרי דורש ייחוס מתאים.

הרישיון המלא ב־Hugging Face ↗