GPT
B

Bespoke-Stratos-17k

קוד פתוח

bespokelabsapache-2.02025-01-21

  • curator
  • synthetic

מאגר שמביא 17 אלף שאלות עם שרשראות חשיבה ותשובות שזוקקו מתוך DeepSeek-R1. הוא נבנה עבור מי שרוצה לאמן מודלי שפה קטנים לנמק צעד אחר צעד במתמטיקה ובקוד.

  • 20,863הורדות בחודש
  • 348לייקים

מה זה

הרשומות מכילות שאלות, מסלולי חשיבה מפורטים ותשובות סופיות. הבסיס נשען על המבנה של Sky-T1, וכולל עשרת אלפים שאלות מתמטיקה מתוך תת המאגרים של NuminaMATH כמו AIME ו־Olympiads, חמשת אלפים בעיות תכנות מתוך APPs ו־TACO, ועוד כאלף חידות ומשימות מדע מתוך STILL-2.

במקום להשתמש במודל QwQ, הצוות הריץ את השאלות מול DeepSeek-R1 כדי לקבל את פלטי החשיבה. תהליך הסינון התבסס על דגימת דחייה שבה נפסלו מסלולי חשיבה שהובילו לפתרון שגוי. בקוד הם נעזרו באשכול Ray להרצה ואימות, ובמתמטיקה הם הפעילו את gpt-4o-mini כדי לבדוק את התשובות, מה שהעלה את שיעור שימור הפתרונות הנכונים מ־25% ל־73%.

מתאים ל

  • זיקוק חשיבה למודלים קטנים

    אימון מודלים של 7B או 32B על עקבות ההסקה של DeepSeek-R1 במתמטיקה.

  • שיפור פתרון בעיות קוד

    כוונון עדין על 5,000 שאלות תכנות עם פתרונות שנבדקו בהרצה.

  • הערכת תהליכי הסקה

    בדיקת היכולת של מודלים לפענח שרשראות חשיבה לוגיות ארוכות.

איפה זה נופל

המאגר כולו מוגדר באנגלית בלבד ואין בו נתוני חשיבה בעברית. הבעיות הן סינתטיות ברובן וממוקדות בתחומי נישה סגורים של קוד, מתמטיקה אולימפית ומדע. אם המודל שלכם מיועד לשיחה כללית, עבודה משרדית או תרגום, הנתונים האלה לא יעזרו. בנוסף, שלב בדיקת הנכונות במתמטיקה הסתמך על שיפוט של gpt-4o-mini, כך שטעויות שיפוט נקודתיות של המודל הבודק עשויות להסתנן פנימה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון המדווח הוא apache-2.0 שאינו מגביל שימוש מסחרי. אתם נדרשים לשמור על תנאי הייחוס והצהרת הרישיון המקורית של Bespoke Labs.

האם המאגר כולל תוכן בעברית?

לא, המאגר מוגדר וקיים בשפה האנגלית בלבד. כל בעיות המתמטיקה, הקוד והחידות נוסחו ונפתרו באנגלית.

במה הוא שונה מ־Sky-T1 המקורי?

המאגר החליף את מודל המקור מ־QwQ ל־DeepSeek-R1 וויתר על עריכת הניסוח שבוצעה בעבר. בנוסף, נעשה שימוש ב־gpt-4o-mini לסינון פתרונות מתמטיים שגויים, מה שאיפשר להציל יותר דוגמאות תקינות.

איך נאספו הנתונים?

השתמשו בכלי בשם Curator כדי להריץ שאלות ממאגרים ידועים מול DeepSeek-R1 בעלות של 800 דולר. לאחר מכן נערך סינון שכלל הרצת קוד בפועל ובדיקת תשובות מתמטיות.

איך טוענים

הנתונים יושבים בקובץ יחיד בפורמט Parquet תחת הנתיב data/train-00000-of-00001.parquet. אין צורך בבקשת גישה מיוחדת או באישור ידני כדי להוריד אותו מ־Hugging Face. הטעינה נעשית ישירות דרך ספריית datasets הרגילה של פייתון, כשהשדות המרכזיים שמעניינים אתכם לאימון הם השאלה, שרשרת הנימוק והתשובה הסופית.

from datasets import load_dataset

ds = load_dataset("bespokelabs/Bespoke-Stratos-17k")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי ומאפשר לשנות את הנתונים, אך דורש מתן קרדיט ושימור הודעות הרישיון המקוריות. אין חובת שיתוף של מודלים או נגזרות תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗