GPT
C

Chinese-Instruct

קוד פתוח

Mxodecc-by-sa-4.02025-04-18

אוסף נרחב של זוגות הוראה ומענה בסינית שמיועד לאימון מודלי שיחה. הוא מאגד נתונים מעובדים ומסוננים ממקורות שונים, כולל זיקוק ממודלים כמו DeepSeek-R1 ו־GPT-4o.

  • 1,429הורדות בחודש
  • 149לייקים

מה זה

המאגר מרכז 14 תתי-מאגרים שונים שנאספו מתוך פרויקטי קוד פתוח מוכרים בקהילה הסינית ועברו עיבוד מחדש. המבנה אחיד לרוחב כל הנתונים, כאשר כל דוגמה מכילה צמד של פרומפט ותשובה בשיחה חד-שלבית, ללא שרשראות שיחה מתמשכות.

התוכן מכסה תחומים כלליים ומקצועיים כאחד. בין השאר יש כאן נתוני חשיבה מזוקקים, מידע רפואי, משפטי, שאלות ותשובות בתכנות בשפת סי, תחומים מדעיים, פסיכולוגיה ואפילו חקלאות. בחלק מהמקורות נעשה סינון היוריסטי, באחרים נבחרו רק דוגמאות שעברו אימות אנושי, או שנלקח החצי העליון לפי ציוני תגמול. תת-המאגר magpie לבדו כולל מעל חצי מיליון רשומות שעברו שכתוב ב־GPT-4o.

מתאים ל

  • כוונון מודלים לסינית כללית

    אימון הוראות בשפה הסינית על מאות אלפי דוגמאות שיחה שנוצרו ועובדו מחדש.

  • התאמה לתחום הרפואי בסין

    אימון מודל על תת-המאגר chinese-medical למענה על שאלות בנושאי בריאות ורפואה.

  • התמחות במושגים משפטיים

    שימוש בתת-המאגר disc-law כדי ללמד מודלים ניסוחים ומענה לשאלות משפטיות בסינית.

  • זיקוק מודלי תכנות ב־C

    אימון יכולות פתרון בעיות קוד בשפת C תוך שימוש בשאלות ותשובות מתורגמות מ־StackOverflow.

איפה זה נופל

הנתונים כולם בסינית בלבד, כך שהם חסרי תועלת לחלוטין למשימות בעברית או באנגלית. בנוסף, בכל תתי-המאגרים שמבוססים על מודלי חשיבה כמו DeepSeek-R1, תהליך המחשבה הוסר לחלוטין ונשמרה רק התשובה הסופית. מי שמחפש ללמד מודל לנמק שלב אחר שלב יצטרך לחפש במקום אחר. יש כאן גם תלות כבדה בטקסט סינתטי שנוצר במודלים כמו GPT-4o-mini ו־DeepSeek-V2.5, ולכן חשוב לבדוק הזיות עובדתיות לפני שמשלבים את המידע בתחומים רגישים כמו רפואה ומשפט.

שאלות
נפוצות

האם יש בדאטהסט תמיכה בעברית?

לא. הדאטהסט כולו מוגדר ומכיל טקסטים בשפה הסינית בלבד. אין בו דוגמאות בעברית או התאמה לשפות שאינן סינית.

האם אפשר להשתמש בו לאימון מודל מסחרי?

הרישיון הוא cc-by-sa-4.0 שמתיר שימוש מסחרי, אך דורש מתן קרדיט ושיתוף באותו רישיון עבור יצירות נגזרות. כדאי להתייעץ משפטית לגבי ההשלכות של סעיף השיתוף הזהה על מודל סגור שאומן על הנתונים.

האם הדאטהסט כולל את שרשרת החשיבה של מודלי ההיגיון?

לא. עבור תתי-המאגרים שזוקקו ממודלים כמו DeepSeek-R1, היוצרים חתכו את תהליך החשיבה והשאירו רק את המענה הסופי.

באיזה פורמט שמורים הנתונים?

הנתונים מאורגנים בקובצי jsonl לפי תתי-מאגרים שונים. המבנה של כל רשומה אחיד וכולל זוג שדות בלבד: prompt ו־response עבור שיחה חד-שלבית.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets בפייתון, ללא צורך בהרשאה מיוחדת או אישור גישה מראש. הקבצים מאוחסנים בפורמט jsonl ומופרדים לפי 14 תתי-הקבוצות. מומלץ לא למשוך את כל המאגר בבת אחת אלא להשתמש בפונקציה get_dataset_config_names כדי לבחור תת-מאגר ספציפי, כמו dpsk-r1-distil או chinese-medical. השדות המרכזיים זהים בכולם: prompt עבור ההוראה ו־response עבור התשובה הסופית.

from datasets import load_dataset

ds = load_dataset("Mxode/Chinese-Instruct")

הרישיון

המאגר מופץ תחת רישיון cc-by-sa-4.0. הרישיון מאפשר שימוש מסחרי, אך הוא כולל תנאי שיתוף זהה ומחייב מתן קרדיט ליוצרים. אם אתם משנים את הנתונים, עליכם להפיץ את הנגזרת תחת אותו הרישיון בדיוק. לגבי משקלי מודל שאומנו על הדאטהסט, קיימת מורכבות משפטית בשאלה האם המודל עצמו נחשב יצירה נגזרת שחייבת להיפתח ברישיון זהה.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗