GPT
O

OpenMementos

קוד פתוח

microsoftmit2026-03-20

  • reasoning
  • chain-of-thought
  • context-compression
  • synthetic
  • memento

microsoft עומדים גם מאחורי Sho, ויש עליו סקירה כאן.

המאגר מכיל 228,557 מסלולי חשיבה מובנים שנועדו לאמן מודלים לנהל בעצמם את הקשר הזיכרון. הוא מתאים למי שרוצה לצמצם את תפיסת הזיכרון בשרשראות חשיבה ארוכות בעזרת סיכום בלוקים.

  • 537הורדות בחודש
  • 66לייקים

מה זה

הרשומות במאגר מבוססות כולן על OpenThoughts-v3, ומחולקות לשלושה תחומים מרכזיים: מתמטיקה עם 123,333 דוגמאות שמקורן ב־openmath-2-math, מדעים עם 61,485 דוגמאות מכימיה אורגנית ופיזיקה, ותכנות עם 43,739 דוגמאות מ־OpenCodeReasoning ומ־codegolf. בכל רשומה יש בעיה ומענה שכולל חלוקה לבלוקים וסיכומי ביניים שנקראים ממנטוס.

תהליך העיבוד פירק שרשראות חשיבה ארוכות למשפטים בודדים, תוך שמירה על בלוקי קוד ונוסחאות. לאחר מכן מודל שפה דירג נקודות חיתוך, אלגוריתם חילק את הטקסט לבלוקים באורך מינימלי של 200 תווים, ולכל בלוק נוצר סיכום דחוס. הסיכומים עברו שיפור איטרטיבי מול מודל שופט עד שהגיעו לציון איכות של 8 מתוך 10, מה שהעלה את אחוז המעבר מ־28% בסבב הראשון ל־92% בסיום.

המאגר מוצע בשתי תצורות. תצורת ברירת המחדל מיועדת לאימון ישיר וכוללת את השאלות והתשובות עם התגים המיוחדים של הבלוקים והסיכומים. תצורת המחקר המלאה חושפת גם את שלבי הביניים: המשפטים המקוריים, נקודות הפיצול של הבלוקים, והסיכומים הנפרדים.

מתאים ל

  • אימון מודלי חשיבה דחוסה

    אימון מודלים שמסכמים שלבי ביניים ומפנים זיכרון במהלך פתרון בעיות ארוכות.

  • מחקר על דחיסת זיכרון

    שימוש בתצורת המאגר המלאה לבדיקת שיטות חלוקה וסגמנטציה חדשות של שרשראות חשיבה.

  • בניית מסלולי הסקה מובנים

    הוראה למודלים לפרק בעיות הנדסיות ומדעיות מורכבות לשלבים קריאים וקצרים.

איפה זה נופל

המאגר כולו באנגלית ומתמקד רק בשלושה תחומים טכניים, ללא תוכן כללי, טקסט הומניסטי או שפות אחרות. אין כאן עברית בכלל, ואי אפשר להשליך מהביצועים במתמטיקה וקוד על משימות שיחה או כתיבה יוצרת.

כל החלוקה והסיכומים נשענים על שיפוט של מודל שפה חיצוני. למרות הסינון, שמונה אחוזים מהסיכומים לא הגיעו לרף האיכות של השופט, ואיכות הממנטו תלויה לחלוטין במה שהשופט האוטומטי ראה כחשוב. לפני שימוש באימון, מומלץ לדגום ידנית מסלולי חשיבה ולוודא שהסיכום לא איבד פרטי חישוב קריטיים שדרושים להמשך הפתרון.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה לפרויקט מסחרי?

כן, הרישיון המוגדר הוא MIT, שמתיר שימוש מסחרי ללא מגבלות מיוחדות. חובת הציות היחידה היא שמירת קרדיט והודעת הרישיון המקורית של מיקרוסופט בקוד או בהפצה. המודלים שמאומנים על הדאטהסט אינם מחויבים ברישיון פתוח.

האם הדאטהסט כולל תמיכה בעברית?

לא, הנתונים מוגדרים באנגלית בלבד. כל השאלות, פתרונות המתמטיקה וההסברים המדעיים מנוסחים באנגלית. שימוש בנתונים אלה לצורך אימון מודל עברי ידרוש תרגום מורכב של מונחים טכניים או איסוף נתונים מקביל.

במה הוא שונה ממאגר OpenThoughts הרגיל?

בעוד שהמאגר המקורי מציע שרשרת חשיבה רציפה וארוכה ללא מבנה מוגדר, כאן הטקסט עבר פירוק וסיכום מובנה. כל מסלול פוצל לחלקי חשיבה נפרדים שלצידם תקציר שמאפשר מחיקת הבלוק המקורי מהזיכרון בזמן ריצה, מה שמוביל לדחיסה של פי שישה בממוצע.

איך נוצרו הסיכומים והחלוקה לבלוקים?

הטקסט פורק למשפטים, ומודל שפה נתן ציון לכל נקודת חיתוך אפשרית. לאחר מכן נבנו בלוקים של לפחות 200 תווים, ולכל בלוק נוצר סיכום שעבר הערכה של מודל שופט עד שני סבבי תיקון כדי להבטיח שהוא משמר את עובדות המפתח להמשך החישוב.

איך טוענים

טוענים את המאגר ישירות בספריית datasets דרך השם שלו, ללא צורך באישור גישה מראש. הקבצים שמורים בפורמט parquet ומחולקים לעשרים קבצי אימון מתוך שישים ושניים קבצים במאגר כולו.

אם אתם מאמנים מודל רגיל, טענו את תצורת ברירת המחדל והשתמשו בעמודות problem ו־response בלבד. שימו לב שהתשובות מכילות טוקנים ייעודיים לתיחום בלוקים וסיכומים, ולכן תצטרכו להגדיר אותם בטוקנייזר לפני שמתחילים באימון.

from datasets import load_dataset

ds = load_dataset("microsoft/OpenMementos")

הרישיון

המאגר משוחרר תחת רישיון MIT. המשמעות היא שמותר להשתמש בו לצרכים מסחריים ומחקריים, לשנות אותו, ולאמן עליו מודלים חופשיים או מסחריים, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗