GPT
C

Chinese-DeepSeek-R1-Distill-data-110k

קוד פתוח

Congliuapache-2.02025-02-17

המאגר מרכז 110 אלף דוגמאות זיקוק של DeepSeek-R1 בסינית מלאה, שמשלבות חשיבה מתמטית עם שיחות ופורומים. הוא נבנה כדי לתת מענה למחסור בחומרי חשיבה איכותיים מחוץ לאנגלית.

  • 1,085הורדות בחודש
  • 782לייקים

מה זה

הנתונים מחולקים לארבע קטגוריות מרכזיות: מעל 58 אלף דוגמאות כלליות מפלטפורמות כמו Zhihu ו־Xiaohongshu, כ־36 אלף דוגמאות מתמטיקה, כ־12 אלף שאלות STEM ועוד כ־2,400 מבחנים. הפרומפטים נאספו ממאגרים סיניים פתוחים כמו GSM8K_zh ו־COIG-CQIA, והורצו מול גרסת ה־671B המלאה בטמפרטורה 0.6 ללא הנחיות מערכת נוספות.

כל רשומה כוללת את שאלת המקור, שרשרת החשיבה, התשובה הסופית, מקור הדאטה וציון איכות. הסינון נעשה בשני צירים: מתמטיקה ומבחנים עברו אימות דרך כלי Math-Verify, וכל השאר דורגו מ־0 עד 10 בעזרת Qwen2.5-72B לפי נכונות, מועילות ובטיחות.

מתאים ל

  • אימון מודלי חשיבה בסינית

    לימוד מודלים קטנים לייצר שרשרת חשיבה מפורטת ומובנית בסינית לפני הפלט.

  • כוונון למתמטיקה ופתרון בעיות

    שימוש בחלק המתמטי והמדעי לחיזוק היכולת של מודל פתוח לנמק פתרונות מורכבים.

  • מחקר על הערכת מודלים

    ניתוח המתאם בין ציוני Qwen2.5-72B ואימות Math-Verify מול איכות הפלט בפועל.

איפה זה נופל

המאגר כולו בסינית בלבד ואין בו מילה בעברית או באנגלית. תהליך הסינון התבסס לחלוטין על מודלים שופטים ולא על עין אנושית, והיוצרים עצמם מודים שהציונים אינם מדויקים לחלוטין. התשובות עלולות להכיל שגיאות עובדתיות שהודלפו ממודל המקור, ומקורות הנתונים החברתיים כמו Zhihu מביאים איתם סגנון דיבור והטיות תרבותיות ספציפיות לרשת הסינית.

אותה משפחה

Chinese-DeepSeek-R1-Distill-data יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון המוגדר הוא apache-2.0 ולכן מבחינת המאגר עצמו מותר להשתמש בו למוצרים מסחריים. עם זאת, הנתונים הם זיקוק ישיר של מודל DeepSeek-R1, כך שחובה לוודא שתנאי השימוש של ספק התשתית אינם מגבילים אימון מודלים מתחרים.

האם יש במאגר נתונים בעברית?

אין במאגר עברית בכלל. כל 110 אלף הדוגמאות מיועדות לשפה הסינית ונאספו מפלטפורמות ומאגרי מידע סיניים בלבד.

כיצד נוצרו הנתונים והתשובות?

היוצרים לקחו פרומפטים ממאגרים סיניים קיימים והזרימו אותם למודל DeepSeek-R1 המלא דרך API חיצוני. לאחר מכן, מודל Qwen2.5-72B וכלי Math-Verify ניתחו את התשובות ונתנו להן ציונים בין 0 ל־10.

מה ההבדל בין הקובץ הזה למאגרי זיקוק אחרים של R1?

רוב מאגרי הזיקוק של R1 מתמקדים באנגלית ובמתמטיקה טהורה. המאגר הזה פונה לשפה הסינית וכולל יותר ממחצית מהנתונים בתחומי שיחה כלליים, היגיון יומיומי ופורומים מקומיים.

איך טוענים

הקובץ המרכזי יושב כ־distill_r1_110k.jsonl ופתוח להורדה ישירה ללא צורך באישור גישה. הוא מכיל שדות נפרדים לתהליך המחשבה ולתשובה, כך שאם אתם עובדים עם סקריפטים סטנדרטיים של אימון הוראות תצטרכו לאחד ביניהם או להוריד את גרסת ה־SFT שהיוצר הכין בנפרד. מומלץ לסנן מראש דוגמאות לפי שדה הציון כדי להיפטר מהזיות.

from datasets import load_dataset

ds = load_dataset("Congliu/Chinese-DeepSeek-R1-Distill-data-110k")

הרישיון

המאגר פורסם ברישיון apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי והפצה, כולל אימון מודלים למוצרים סגורים. התנאי העיקרי הוא שמירה על הודעת הרישיון ומתן ייחוס ליוצרים, ללא חובה לשחרר את המשקלים או את הנגזרות שלכם תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗