GPT
L

Light-R1-SFTData

קוד פתוח

qihoo360apache-2.02025-03-04

המאגר כולל נתוני אימון בשני שלבים שנועדו להקנות למודלי שפה יכולות חשיבה ופתרון בעיות מתמטיות מורכבות. הוא נבחר בעיקר כדי להגיע לביצועי זיקוק גבוהים בעלויות אימון נמוכות וללא זיהום מבחנים.

  • 693הורדות בחודש
  • 61לייקים

מה זה

המאגר מחולק לשני קובצי JSON המייצגים שלבי אימון מדורגים. השלב הראשון מכיל 76,000 דוגמאות שנאספו משאלות של מאגרים פתוחים כמו OpenR1-Math-220k, OpenThoughts-114k, LIMO, OpenMathInstruct-2, s1K-1.1, Omni-MATH, hendrycks_math ומבחני AIME עד שנת 2023. התשובות הופקו באמצעות מודל DeepSeek-R1, ועברו סינון לפי אימות נכונות ודירוג רמות קושי שנמדדו על ידי דגימת DeepScaleR-1.5B-Preview.

השלב השני מורכב מקובץ של 3,000 דוגמאות בלבד. החלק הזה כולל שאלות קשות במיוחד שסוננו ברובן מתוך מאגר 76 האלפים של השלב הראשון. בנוסף, כלל השאלות עברו תהליך ניקוי קפדני בהשוואת מחרוזות ו־N-gram מול מבחני ביצועים נפוצים כמו AIME24, AIME25, MATH-500 ו־GPQA Diamond כדי למנוע דליפת מידע.

מתאים ל

  • אימון מודל מתמטי מדורג

    אימון מודלי בסיס לפתרון שאלות מתמטיות קשות באמצעות מעבר משלב ראשון רחב לשלב שני ממוקד.

  • זיקוק שרשראות חשיבה

    הקניית יכולות חשיבה ארוכות של DeepSeek-R1 למודלים קטנים וקלים יותר בתקציב מחשוב נמוך.

  • אימון נקי מזיהום מבחנים

    בניית מודלים ייעודיים לבדיקה על מבחני AIME24 ו־AIME25 ללא חשש מזיהום ישיר של דוגמאות האימון.

איפה זה נופל

הנתונים עוסקים אך ורק במתמטיקה באנגלית, ואינם כוללים עברית או תחומי ידע כלליים. המפתחים מציינים במפורש שההתמקדות במתמטיקה גרמה לשכחה מסוימת בביצועים על שאלות מדעיות במבחן GPQA, ולכן המאגר יפגע ביכולות של מודל שצריך לענות על נושאים מגוונים. כמו כן, המודל שאומן עליהם אינו מייצר תהליך חשיבה מעצמו ומחייב הזרקה ידנית של תגית הפתיחה בתבנית השיחה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. המאגר פורסם תחת רישיון Apache 2.0, שמאפשר שימוש מסחרי מלא באימון מודלים ובמוצרים. התנאי העיקרי הוא שימור הודעות זכויות היוצרים והרישיון המקורי.

האם המאגר כולל תוכן בעברית?

לא. השאלות נלקחו ממאגרים בינלאומיים של תחרויות מתמטיקה ומבחנים, והתשובות מ־DeepSeek-R1 נכתבו כולן באנגלית. שימוש בו לא יתרום לשיפור יכולות השפה העברית של המודל שלכם.

איך סיננו את הנתונים כדי למנוע זיהום של מבחני ביצועים?

החוקרים ביצעו סינון מול AIME24, AIME25, GPQA Diamond ו־MATH-500 באמצעות התאמה מלאה והתאמת N-gram. הם הסירו שאלות זהות או שאלות שבהן רק שונו מספרים, והגבילו את שאלות העבר של AIME עד שנת 2023 בלבד.

מה מייחד את המאגר הזה לעומת מאגרי שרשראות חשיבה אחרים?

המאגר מובנה לפי עקרון של למידה מדורגת, עם חלוקה לשלב בסיסי של 76,000 דוגמאות ושלב שני של 3,000 שאלות ברמת קושי גבוהה שנבדקו מול מודל חיצוני. מבנה זה אפשר לחוקרים לעקוף את הביצועים של DeepSeek-R1-Distill המקורי על AIME בהשקעת זמן אימון קצרה.

איך טוענים

טוענים את הנתונים ישירות מקובצי stage1-76k.json ו־stage2-3k.json באמצעות ספריית datasets או קריאת JSON רגילה בפייתון. המאגר פתוח לחלוטין לציבור ואינו דורש אישור גישה מראש. הנתונים מיועדים למשימות יצירת טקסט ומכילים שרשראות חשיבה ארוכות, כאשר צוות הפיתוח השתמש בהם בסביבת 360-LLaMA-Factory עם תגיות החשיבה של Qwen.

from datasets import load_dataset

ds = load_dataset("qihoo360/Light-R1-SFTData")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי והפצה של הנתונים ושל מודלים שאומנו עליהם. הרישיון דורש מתן קרדיט וצירוף עותק הרישיון והודעות זכויות היוצרים המקוריות, ללא חובת שיתוף של תוצרים תחת אותו רישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗