GPT
M

Multilingual-Thinking

קוד פתוח

HuggingFaceH4apache-2.02025-08-01

המאגר מרכז תהליכי חשיבה מנומקים שתורגמו מאנגלית לארבע שפות אירופיות מרכזיות. הוא נועד למי שרוצה לאמן מודלים להציג את שלבי ההיגיון שלהם גם מחוץ לאנגלית.

  • 9,576הורדות בחודש
  • 118לייקים

מה זה

הנתונים מבוססים על דגימה של אלף רשומות מתוך תת המאגר SystemChat של פרויקט SmolTalk2. במקור תהליכי החשיבה נוצרו באנגלית, וצוות הפיתוח תרגם את עקבות הנימוק לשפות ספרדית, צרפתית, איטלקית וגרמנית באמצעות מודל שפה ייעודי.

המבנה הפנימי תואם את פורמט התגובות Harmony שפותח כדי לחקות את ממשק התגובות של OpenAI. שיחות אלו שימשו במדריך הרשמי של OpenAI Cookbook לכוונון עדין של מודלי gpt-oss. כל רשומה כוללת הודעות מפתח, הודעות משתמש ותשובות של העוזר שמחולקות בין ניתוח מחשבתי פנימי לתשובה הסופית שנחשפת למשתמש.

מתאים ל

  • אימון מודלי חשיבה רב לשוניים

    לימוד מודלים לייצר עקבות חשיבה בספרדית, גרמנית, צרפתית ואיטלקית.

  • התאמת פורמט OpenAI Responses

    כוונון מודלים בקוד פתוח לעבודה עם מבנה הודעות שמפריד חשיבה מתוכן.

  • שחזור מתכוני אימון מ־OpenAI

    הרצת מדריכי אימון מתוך OpenAI Cookbook על מודלי gpt-oss.

איפה זה נופל

החיסרון המרכזי כאן הוא גודל המדגם, אלף דוגמאות בלבד, שאינן מספיקות לאימון מלא של יכולות חשיבה מאפס אלא רק לכוונון עדין שטחי. בנוסף, שרשראות הנימוק לא נכתבו במקור בשפות היעד אלא תורגמו על ידי מודל שפה, מה שעלול לייצר שגיאות תרגום או כשלים לוגיים עדינים שלא סוננו ידנית. אין כאן עברית בכלל, אלא רק אנגלית, גרמנית, צרפתית, ספרדית ואיטלקית.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. המאגר מכיל רק חמש שפות: אנגלית, גרמנית, צרפתית, ספרדית ואיטלקית. אם המטרה היא אימון בעברית, הנתונים האלה לא יעזרו לכם.

האם מותר להשתמש במאגר למטרות מסחריות?

כן. המאגר פורסם ברישיון apache-2.0, שמאפשר שימוש מסחרי מלא, שינוי הנתונים ואימון מודלים מסחריים. תצטרכו רק לשמור על הקרדיט והעתק הרישיון.

מאיפה הגיעו תהליכי החשיבה?

הדוגמאות נדגמו מתוך SmolTalk2, ספציפית מתת המאגר SystemChat. שרשראות הנימוק שתורגמו הופקו במקור באנגלית ועובדו לשפות האחרות באמצעות מודל שפה.

באיזה פורמט שמורות השיחות?

השיחות בנויות במבנה Harmony שמפצל את תגובת העוזר לשני שדות נפרדים. שדה אחד מוקדש לחשיבה הפנימית והשדה השני מיועד לתוכן הסופי שחוזר למשתמש.

איך טוענים

טוענים את המאגר ישירות עם ספריית datasets של פייתון דרך HuggingFaceH4/Multilingual-Thinking עבור החלק train. הגישה פתוחה לחלוטין ללא צורך בהרשמה מוקדמת או באישור מיוחד. כל הנתונים יושבים בקובץ parquet בודד, כך שההורדה מתבצעת בשניות בודדות. השדות הקריטיים לעיבוד הם messages, וספציפית בתוך תשובת העוזר השדות thinking שמחזיק את שרשרת ההיגיון ו־content שמכיל את הפלט הגלוי.

from datasets import load_dataset

ds = load_dataset("HuggingFaceH4/Multilingual-Thinking")

הרישיון

המאגר מופץ תחת רישיון apache-2.0 המאפשר שימוש מסחרי, שינוי והפצה של הנתונים כמעט ללא הגבלה. אין חובה לשתף פרויקטים נגזרים תחת אותו הרישיון. מותר לאמן על המאגר מודלים לשימוש פנימי או למוצרים מסחריים, כל עוד שומרים על הודעת זכויות היוצרים וההצהרה המקורית של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗