GPT
S

s1K-1.1

קוד פתוח

simplescalingmit2025-02-07

  • curator

אלף שאלות חשיבה מורכבות עם עקבות פתרון מלאים שנוצרו על ידי מודלים חזקים. המטרה כאן היא לאמן מודלים להסביר את תהליך המחשבה שלהם בעזרת דאטהסט קטן ומדויק במקום מליוני דוגמאות.

  • 8,881הורדות בחודש
  • 157לייקים

מה זה

המאגר כולל בדיוק אלף שאלות מתוך הדאטהסט המקורי s1K, שמגיעות יחד עם פתרון האמת שלהן. במקום להסתפק רק בתשובה הסופית, כל רשומה מציגה את מסלול החשיבה המלא שנוצר על ידי מודלים שונים כדי להגיע אליה. הגרסה הזו מתמקדת במסלולי חשיבה שהופקו באמצעות DeepSeek r1, שלפי החוקרים מביאים לביצועים טובים בהרבה בהשוואה לגרסאות קודמות.

בתוך כל רשומה תמצאו את השאלה המקורית, פתרון האמת, קטגוריית השאלה ומקור הנתונים שממנו היא נלקחה. לצד אלה שמורים שני מסלולי חשיבה נפרדים: אחד שנוצר באמצעות Gemini Flash Thinking Experimental והשני באמצעות DeepSeek r1, לצד הניסיונות והתשובות שכל מודל החזיר בפועל. החלוקה פשוטה מאוד ומכילה רק פיצול אימון יחיד, בלי חלוקות מובנות לבדיקה או תיקוף.

מתאים ל

  • אימון מודל לחשיבה שלב אחר שלב

    כוונון עדין של מודלים קטנים כדי שילמדו לייצר מסלולי חשיבה ארוכים ומנומקים לפני שהם עונים על שאלות קשות.

  • השוואת איכות בין מודלי חשיבה

    בדיקת ההבדלים בניסוח ובדיוק הפתרונות בין DeepSeek r1 לבין ג'מיני על אותן אלף שאלות בדיוק.

  • מחקר על יעילות זמן בדיקה

    שחזור והרחבה של תוצאות המאמר המקורי לבדיקת שיפור ביצועים באמצעות הארכת זמן החשיבה של המודל.

איפה זה נופל

הנתונים כולם באנגלית בלבד ואין פה מילה אחת בעברית, כך שאם אתם בונים מודל לשפה המקומית תצטרכו לתרגם הכל או להשתמש במקור אחר. בנוסף מדובר באלף דוגמאות בלבד, מדגם זעיר שמתאים בעיקר לכוונון עדין של יכולות חשיבה ולא לבניית ידע מאפס. השאלות והפתרונות נוצרו וסוננו בעזרת מודלים מסחריים ספציפיים, מה שאומר שהטיות או טעויות חשיבה של DeepSeek r1 וג'מיני נכנסו ישירות לתוך הדאטה.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה לפרויקט מסחרי?

כן, הרישיון המדווח הוא רישיון MIT שמאפשר שימוש מסחרי מלא בלי הגבלות מיוחדות. צריך רק לוודא שאתם משאירים את הצהרת זכויות היוצרים המקורית.

כמה שוקל הדאטהסט והאם צריך אישור גישה?

המאגר פתוח לציבור ואינו דורש שום תהליך אישור או מפתח מיוחד. הוא מכיל אלף שורות בקובץ parquet בודד, כך שהמשקל שלו זניח והוא יורד תוך שניות.

האם יש בו שאלות בעברית?

לא, כל השאלות, התשובות ומסלולי החשיבה במאגר כתובים באנגלית בלבד. כדי להשתמש בו עבור מודלים בעברית תידרש עבודת תרגום והתאמה.

מה ההבדל בין המאגר הזה לגרסה המקורית של s1K?

השאלות עצמן זהות לחלוטין לאלף השאלות מהמאגר הראשון. ההבדל הוא שבגרסה הזו עקבות החשיבה נוצרו מחדש באמצעות DeepSeek r1 במקום המודל הקודם, מה שמשפר את איכות האימון.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets של פייתון באמצעות simplescaling/s1K-1.1, והמאגר פתוח לגמרי בלי צורך בבקשת גישה או אישור מיוחד. כל המידע יושב בקובץ parquet יחיד, כך שההורדה מהירה מאוד ולא דורשת משאבי אחסון מיוחדים. בזמן העבודה כדאי לשים לב לשדות של עקבות החשיבה, deepseek_thinking_trajectory ופתרון האמת solution, שהם עיקר התוכן הרלוונטי לאימון.

from datasets import load_dataset

ds = load_dataset("simplescaling/s1K-1.1")

הרישיון

המאגר מופץ תחת רישיון MIT. הרישיון הזה מתיר שימוש מסחרי ומחקרי חופשי לחלוטין, כולל שינוי, הפצה ואימון מודלים, בלי דרישה לשתף את התוצרים באותו רישיון. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בתוכנה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗