GPT
S

smoltalk-chinese

קוד פתוח

opencsgapache-2.02024-12-25

המאגר כולל מעל 700 אלף רשומות סינתטיות בסינית שנועדו לכוונון מודלי שפה למגוון שיחות ומשימות הוראה. הוא מתאים למי שרוצה לאמן מודל בסינית בלי להסתמך רק על תרגום ישיר מאנגלית.

  • 1,879הורדות בחודש
  • 52לייקים

מה זה

כל הנתונים במאגר נוצרו באופן סינתטי בעזרת שיטת Magpie וספריית Distilabel, תוך שימוש במודלים DeepSeek-v2.5 ו־Qwen2.5-72B-Instruct. הרשומות מקיפות שיחות קצרות של סיבוב בודד למשימות כמו סיכום, תרגום וציות להגבלות פורמט, לצד שיחות של שלושה סיבובים במשימות תכנות, כתיבה ופתרון בעיות, ושיחות יומיומיות של חמישה סיבובים. בנוסף שולבו בעיות מתוך Math23K בסינית עם שלבי חשיבה מפורטים.

סינון המידע נעשה בשני שלבים. המודל Qwen2-7B-Instruct דירג את הבהירות והשטף של ההוראה הראשונה בסולם של אפס עד חמש, ורק פניות שקיבלו ציון שתיים ומעלה נשמרו. לאחר מכן קודדה ההוראה הראשונה בעזרת gte-large-zh, ובוצע ניקוי כפילויות לפי דמיון וקטורי בסף של 0.8.

מתאים ל

  • אימון הוראות בסינית

    כוונון עדין של מודלי שפה קטנים או גדולים לביצוע משימות כלליות ושיחה בשפה הסינית.

  • שיפור פתרון בעיות מתמטיות

    אימון מודלים על שרשראות חשיבה מפורטות בסינית המבוססות על שאלות Math23K.

  • הערכת עמידה בהנחיות פורמט

    בדיקת יכולת המודל לייצר פלטים מדויקים לפי הגבלות מבנה נוקשות בסיבוב יחיד.

איפה זה נופל

כל התוכן במאגר סינתטי לחלוטין ונשען על מודלים של DeepSeek ו־Qwen, ולכן הוא חשוף להזיות ולדפוסי ניסוח מלאכותיים של אותם מודלים. סף הסינון שנבחר נמוך למדי, ציון שתיים מתוך חמש, מה שמשאיר בפנים גם דוגמאות באיכות בינונית. אין במאגר שום ייצוג לעברית, והוא מכיל אך ורק סינית עם מעט תרגום לאנגלית. אם אתם בונים מוצר שפונה לשוק הישראלי, הנתונים האלה לא יעזרו באופן ישיר לשיחה מקומית.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

לא באופן אוטומטי. למרות הסימון של Apache 2.0, תנאי היוצרים קובעים כי לכל שימוש מסחרי במודל או בנגזרותיו יש לפנות למייל lorraineg@opencsg.com ולקבל אישור מראש תחת רישיון הקהילה שלהם.

האם המאגר כולל תוכן בעברית?

לא. הנתונים מיועדים בלעדית לסינית, למעט משימת תרגום נקודתית בין סינית לאנגלית. לפיתוח מוצר בעברית המאגר אינו רלוונטי.

איך המידע נוצר וסונן?

כל הדאטה יוצר באופן סינתטי בעזרת Magpie, DeepSeek-v2.5 ו־Qwen2.5-72B-Instruct. הסינון כלל שמירת הוראות שקיבלו ציון שתיים ומעלה ממודל Qwen2-7B-Instruct, וניקוי כפילויות לפי דמיון אמבדינג של gte-large-zh בסף 0.8.

כמה רשומות יש במאגר ואיך הוא בנוי?

הכרטיס מדווח על מעל 700 אלף רשומות סינתטיות. המאגר מפוצל לעשרים ושישה קבצים לפי נושאים בפורמט parquet, הכוללים שיחות בסיבוב בודד, שלושה סיבובים וחמישה סיבובים.

איך טוענים

הנתונים מחולקים לעשרים ושישה קבצים, רובם בפורמט parquet לפי שמות המשימות כמו coding, document-qa ו־brainstorming. אפשר לטעון כל משימה בנפרד לפי צורכי האימון, ללא צורך בהרשאת גישה מיוחדת להורדה. יש לשים לב שהסינון והסרת הכפילויות נעשו רק על בסיס הפנייה הראשונה בשיחה, כך שתוכן התשובות והסיבובים הבאים דורש בדיקה עצמאית לפני תחילת הריצה.

from datasets import load_dataset

ds = load_dataset("opencsg/smoltalk-chinese")

הרישיון

הרישיון המוגדר במטא-דאטה הוא Apache 2.0, אך הטקסט של היוצרים מוסיף מגבלה משמעותית. שימוש מסחרי במאגר או בתוצרים שנגזרו ממנו מחייב ציות לתנאי הקהילה של OpenCSG ודורש שליחת מייל לכתובת lorraineg@opencsg.com וקבלת אישור מפורש מראש. מבחינה מעשית, זה שולל שימוש מסחרי חופשי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗