GPT
C

Chinese-DeepSeek-R1-Distill-data-110k-SFT

קוד פתוח

Congliuapache-2.02025-02-17

המאגר מרכז 110K דוגמאות בסינית שנוצרו מזיקוק של DeepSeek-R1 המלא ומיועדות ל־SFT ישיר. הוא עונה על המחסור הקיים בדאטהסטים מבוססי חשיבה שלא מוגבלים לאנגלית בלבד.

  • 640הורדות בחודש
  • 225לייקים

מה זה

המאגר כולל 110K רשומות שבהן תהליך החשיבה והתשובה הסופית אוחדו מראש לתוך שדה output יחיד, במטרה להתאים ישירות לתשתיות אימון סטנדרטיות. החלוקה הפנימית כוללת 58352 דוגמאות כלליות מתחומי שיחה, היגיון ותוכן מפלטפורמות כמו Zhihu ו־Xiaohongshu, לצד 36568 דוגמאות מתמטיקה, 12648 דוגמאות STEM ו־2432 שאלוני בחינות.

הפרומפטים נאספו ממאגרים ציבוריים מוכרים כמו GSM8K_zh, COIG-CQIA, Haijian/Advanced-Math, EduChat-Math, applied_math, neo_sft_phase2 ו־stem_zh_instruction. התוכן יוצר באמצעות ממשק ה־API המלא של DeepSeek-R1 בטמפרטורה 0.6, ללא פרומפט מערכת נוסף, עם הוראה להסקה שלב אחר שלב במתמטיקה והוספת ירידת שורה בתחילת הפלט.

בדיקת האיכות התבצעה באמצעות Math-Verify לדוגמאות מתמטיקה ומבחנים, ורשומות שלא נבדקו כך דורגו על ידי Qwen2.5-72B-Instruct בציון 0 או 10. שאר הנתונים קיבלו דירוג של 0 עד 10 מהמודל לפי מועילות, דיוק וחוסר נזק, כאשר הדירוגים והמקור לכל רשומה נשמרו בנתונים.

מתאים ל

  • אימון מודלים בסינית

    ביצוע SFT ישיר למודלי שפה בסינית הדורשים יכולות פתרון בעיות וחשיבה מורכבת.

  • פתרון בעיות מתמטיקה

    שיפור ביצועים במשימות מתמטיקה ו־STEM בזכות עשרות אלפי דוגמאות מנומקות צעד אחר צעד.

  • סינון נתונים לאימון

    בניית תתי-מאגרים איכותיים תוך שימוש בציוני הבדיקה של Math-Verify ו־Qwen שנשמרו ברשומות.

איפה זה נופל

הנתונים כולם בסינית בלבד, ואין כאן תוכן באנגלית או בעברית. היות שהפלט נוצר כולו על ידי DeepSeek-R1 ללא בדיקה אנושית ידנית, קיימות טעויות עובדתיות וחוסר דיוק. בנוסף, הציונים ברשומות מבוססים על שיפוט אוטומטי של Qwen2.5-72B-Instruct, ולכן אינם מדויקים לחלוטין. לפני שילוב הנתונים באימון מודל, תצטרכו לסנן אותם בעצמכם על בסיס הדירוגים והצרכים שלכם.

אותה משפחה

Chinese-DeepSeek-R1-Distill-data יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם יש במאגר נתונים בעברית?

לא. המאגר מוגדר לשפה הסינית בלבד (zh) ומכיל פרומפטים ותשובות שמקורם בפלטפורמות ובדאטהסטים סיניים. הוא אינו מיועד לפיתוח ישיר בעברית.

האם מותר להשתמש בדאטהסט לפרויקט מסחרי?

הרישיון המדווח במאגר הוא apache-2.0, שמאפשר שימוש מסחרי חופשי והפצה. עם זאת, יש לוודא עמידה בתנאי השימוש של מודל המקור DeepSeek-R1 שבאמצעותו ייוצרו הנתונים.

מה ההבדל בין מאגר זה לגרסה הראשית שלו?

גרסה זו מאחדת את שלב החשיבה ואת התשובה הסופית לתוך שדה output יחיד. המבנה הזה נבנה כדי לאפשר טעינה ישירה לתוך סביבות SFT סטנדרטיות בלי צורך בעיבוד נוסף של הטקסט.

איך סוננה איכות התוכן בדאטהסט?

נתוני המתמטיקה והבחינות נבדקו באמצעות Math-Verify ו־Qwen2.5-72B-Instruct. שאר הנתונים הכלליים דורגו על ידי אותו מודל בסולם של 0 עד 10 על פי פרמטרים של דיוק, תועלת ובטיחות.

איך טוענים

הקובץ המרכזי במאגר הוא distill_r1_110k_sft.jsonl, שבו שדה ה־output מכיל את תהליך החשיבה לצד התשובה. כל שורה מכילה גם את שדה repo_name כדי לאפשר מעקב אחרי מקור הפרומפט, יחד עם שדות הניקוד של הבדיקה. אין צורך באישור גישה מיוחד כדי להוריד את הקובץ. אפשר לטעון אותו ישירות באמצעות ספריית datasets של Hugging Face או לקרוא את קובץ ה־JSONL לתוך כל מסגרת אימון נפוצה.

from datasets import load_dataset

ds = load_dataset("Congliu/Chinese-DeepSeek-R1-Distill-data-110k-SFT")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הקבצים, ודורש שימור של הודעות זכויות היוצרים והרישיון המקורי. הוא אינו כופה שיתוף באותו רישיון עבור תוצרים נגזרים, כך שניתן לאמן עליו מודלים מסחריים בכפוף לתנאי הרישיון הסטנדרטיים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗