GPT
S

SynLogic

קוד פתוח

MiniMaxAImit2025-05-25

  • logical reasoning

מאגר נתונים סינתטי למשימות היגיון שמיועד לאימון מודלי שפה בלמידת חיזוק עם בדיקה אוטומטית של פתרונות. הוא כולל חידות מגוונות עם רמות קושי מוגדרות מראש לשני גדלים שונים של מודלים.

  • 1,663הורדות בחודש
  • 106לייקים

מה זה

המאגר מציע 35 סוגים שונים של משימות חשיבה לוגית, כמו סודוקו, משחק ה־24, כתבי סתרים, מבוכי חצים ומשימות אריתמטיקה מילולית. כל הנתונים נוצרו בצורה סינתטית במטרה לספק מנגנון אימות מובנה לכל פתרון, מה שמתאים בעיקר להגדרת תגמולים מדויקים באימוני למידת חיזוק.

התוכן מחולק לשתי גרסאות עבודה עיקריות. הראשונה, SynLogic-Easy, מכילה 27 משימות וכוללת כ־16,000 דוגמאות אימון, ומכוונת למודלים קטנים יותר בסביבות 7B פרמטרים. הגרסה השנייה, SynLogic-Hard, כוללת את כל 35 המשימות ומונה כ־33,000 דוגמאות אימון, ומיועדת למודלים גדולים יותר באזור 32B פרמטרים. המאגר מכיל קובצי אימון ואימות נפרדים לכל רמת קושי.

מתאים ל

  • אימון למידת חיזוק

    שימוש במנגנון האימות האוטומטי של החידות להגדרת תגמול מדויק באימון מודלים.

  • בנצ'מרק חשיבה לוגית

    בדיקת יכולות פתרון בעיות מורכבות כמו סודוקו וכתבי סתרים על סטים מוכנים.

  • התאמת מודלים קטנים

    אימון מודלים סביב 7B על גרסת ה־Easy שתוכננה מראש למגבלות הגודל שלהם.

איפה זה נופל

הנתונים כולם סינתטיים וממוקדים בלוגיקה טהורה, מה שאומר שהם לא מייצגים שפה טבעית או שאלות משתמשים אמיתיות. השפות המוגדרות במאגר הן אנגלית וסינית בלבד, ואין כאן עברית כלל.

בנוסף, חלק מהמשימות דרשו תיקוני תקלות בעדכונים מאוחרים, כמו כפילויות בפרומפטים במשימות דמויות ARC ותיקוני מידע בביטויים בוליאניים, כך שכדאי לוודא שמושכים את הגרסה המעודכנת ביותר לפני האימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר זמין תחת רישיון MIT שמאפשר שימוש מסחרי מלא ללא הגבלה על מודלים שמאומנים בעזרתו. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים המקורית בקוד או בתיעוד. אין חובה לפתוח את המשקלים או את הקוד של המודל שלכם.

האם יש במאגר תמיכה בעברית?

לא, המאגר מוגדר לשפות אנגלית וסינית בלבד ואין בו נתונים בעברית. מאחר שמדובר בחידות לוגיות כמו סודוקו ומשחקי מספרים, חלק מהמשימות תלויות פחות בשפה, אך ההוראות והפרומפטים מנוסחים באנגלית ובסינית בלבד.

מאיפה הגיעו הנתונים ואיך הם נוצרו?

כל הדוגמאות נוצרו באופן סינתטי על ידי MiniMaxAI סביב 35 סוגי בעיות לוגיות מוגדרות. הנתונים לא נאספו מרחבי הרשת, אלא הופקו על בסיס חוקים שמאפשרים לבדוק כל פתרון בעזרת קוד אימות אוטומטי.

במה המאגר הזה שונה ממאגרי שאלות ותשובות רגילים?

בניגוד למאגרי טקסט כלליים, המאגר הזה בנוי במיוחד עבור למידת חיזוק שבה נדרש אימות ודאי של התוצאה. המשימות מחולקות מראש לפי דרגות קושי שמתאימות למודלים של 7B או 32B, עם פתרונות שניתן לבדוק ישירות בקוד.

איך טוענים

טעינת המידע פשוטה ונעשית ישירות דרך ספריית datasets באמצעות פקודת load_dataset עם ציון התצורה הרצויה, easy או hard. אין צורך בבקשת גישה מיוחדת, והקבצים זמינים להורדה חופשית.

הנתונים נשמרים כקבצי parquet, כך שהטעינה והקריאה שלהם בסביבת פייתון מהירות למדי. המאגר כולל פיצול מובנה לקובצי אימון ובדיקה עבור כל אחת משתי רמות הקושי, מה שמקל על שילוב ישיר בצנרת אימון קיימת של למידת חיזוק או הערכת ביצועים.

from datasets import load_dataset

ds = load_dataset("MiniMaxAI/SynLogic")

הרישיון

המאגר מופץ תחת רישיון MIT. מדובר ברישיון מתירני שמאפשר שימוש מסחרי, מחקרי ושינוי של הנתונים, בכפוף לשמירה על הודעת זכויות היוצרים המקורית. אין חובה לשתף נגזרות באותו רישיון, כך שמודל שאומן על הנתונים אינו מוגבל בהפצה מסחרית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗