GPT
U

Updesh_beta

קוד פתוח

microsoftother2025-06-24

  • Updesh
  • synthetic data
  • microsoft
  • multilingual

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

מאגר סינתטי של מיקרוסופט לאימון הוראות בשפות הודיות. הוא משלב תרגום משימות היגיון לצד יצירת תוכן מקומי מוויקיפדיה כדי לתת מענה למודלים קטנים.

  • 9,588הורדות בחודש
  • 16לייקים

מה זה

המאגר מורכב משני חלקים עיקריים ומכיל בין מיליון לעשרה מיליון רשומות. המבנה של כל רשומה כולל הוראת מערכת, בקשת משתמש ותשובת עוזר, בחלקן בשיחות מרובות שלבים. החלק הראשון מכיל כ 6.8 מיליון דוגמאות של משימות היגיון ומתמטיקה מתוך OrcaMath ו Orca AgentInstruct, שתורגמו ל 13 שפות הודיות באמצעות Llama 3.1 405B Instruct. המשימות האלה כוללות הבנת הנקרא, שאלות רב ברירה ובעיות מילוליות.

החלק השני כולל כ 2.1 מיליון רשומות גנרטיביות שנוצרו על בסיס ערכי ויקיפדיה מתחילת 2025 באמצעות המודל Qwen3 235B A22B. כאן הדגש הוא על כתיבה יוצרת, סיכום, דיאלוגים והסקה רב שלבית בהקשר תרבותי מקומי.

מתאים ל

  • אימון מודלים לשפות הודיות

    התאמת מודלי שפה להבנת הנחיות ב 13 שפות הודיות עם הקשר תרבותי.

  • הערכת יכולות הסקה

    בדיקת ביצועים של מודלים קיימים במשימות מתמטיקה והיגיון שתורגמו מאורקה.

  • מחקר על דאטה סינתטי

    ניתוח השפעת אימון על תוכן סינתטי מתורגם מול תוכן שנוצר מוויקיפדיה.

איפה זה נופל

זהו שחרור בטא ראשוני, ולכן חלק מתהליכי הסינון עדיין לא הושלמו. הנתונים מבוססים על יצירה ותרגום של מודלי שפה אחרים, מה שגורר בהכרח שגיאות תרגום והזיות סינתטיות. המאגר מכסה רק שפות הודיות ואנגלית, ללא עברית כלל. בנוסף, חלקי ההיגיון מתבססים על תרגום מאנגלית ולא על תוכן שנכתב במקור בשפת היעד.

שאלות
נפוצות

האם המאגר מתאים לשימוש מסחרי?

לא, המאגר פורסם תחת רישיון מחקר ייעודי של מיקרוסופט. הרישיון מגביל את השימוש לצרכים אקדמיים ומחקריים בלבד. אם המטרה היא לאמן מודל למוצר מסחרי, הנתונים האלה לא מתאימים.

האם יש במאגר נתונים בעברית?

אין במאגר עברית בכלל. הוא מתמקד אך ורק ב 13 שפות הודיות לצד חלק גנרטיבי באנגלית. הוא לא יועיל למי שמחפש לשפר ביצועים בעברית.

מאיפה הגיעו הנתונים ואיך יצרו אותם?

הנתונים נוצרו בשני מסלולים סינתטיים שונים לחלוטין. משימות ההיגיון והמתמטיקה תורגמו ממאגרי אורקה הקיימים באמצעות מודל Llama 3.1 405B Instruct. המשימות הגנרטיביות נוצרו ישירות מערכי ויקיפדיה בעזרת המודל Qwen3 235B A22B.

מה ההבדל בינו לבין תרגום רגיל של מאגרים קיימים?

בניגוד לפרויקטים שמתרגמים רק שאלות מאנגלית, כאן שילבו יצירת תוכן מקומי מתוך ויקיפדיה בשפות היעד. הגישה הזו נועדה להביא ידע והקשר תרבותי מקומי שלא קיימים במאגרים מערביים. עם זאת, כל חלקי ההיגיון הם עדיין תרגום של חומר קיים.

איך טוענים

הנתונים מחולקים לפי משימות ושפות בקובצי parquet, כאשר במאגר יש 254 קבצים בסך הכל. אפשר לטעון ישירות דרך ספריית datasets בלי צורך לבקש אישור גישה מראש. שדות המפתח הם ההוראה, שאלת המשתמש והתשובה. שימו לב שהחלק המתורגם אינו כולל את הגרסה האנגלית המקורית, כך שאם אתם מאמנים מודל רב לשוני, תצטרכו למשוך את המקור האנגלי בנפרד.

from datasets import load_dataset

ds = load_dataset("microsoft/Updesh_beta")

הרישיון

הרישיון מוגדר תחת תנאי מחקר של מיקרוסופט ולא כרישיון קוד פתוח רגיל. הוא מיועד למחקר בלבד ואינו מתיר שימוש מסחרי ישיר. מודל שתאמנו על הנתונים האלה יהיה מוגבל לאותם תנאים, כך שלא תוכלו לשלב אותו במוצר מסחרי.

הרישיון המלא ב־Hugging Face ↗