GPT
S

SYNTH

קוד פתוח

PleIAscc-by-4.02025-11-10

  • wikipedia
  • art
  • math
  • writing

מאגר סינתטי עצום שנועד לאמן מודלי חשיבה קטנים ממאגר ידע מוגדר. הוא מתאים למי שרוצה לאמן מודל קומפקטי מאפס בלי לשאוב טקסט חי מהאינטרנט.

  • 22,176הורדות בחודש
  • 275לייקים

מה זה

המאגר כולל 79,648,272 רשומות טקסט סינתטיות עם מעל 41 מיליארד מילים, שמתורגמות לכ־75 מיליארד טוקנים בטוקנייזר של המפתחים. כל רשומה מייצגת תרגיל סינתטי ומכילה שאילתה, אילוצי יצירה, טיוטת נימוק של שלבי החשיבה ותשובה סופית, לצד המקורות שעליהם היא נשענת.

בסיס הנתונים מורכב מגרעין של 50,000 ערכים נבחרים מוויקיפדיה באנגלית מתוך מיזם הערכים החיוניים, אליהם נוספו עוד 8,698 ערכים מקצועיים בתחומי משפט, רפואה וכימיה, 3,727 דפי מתכונים ממיזם ויקיספר, ועוד 130 טקסטים שנכתבו ידנית על אירועים עדכניים ומחקר בינה מלאכותית. החומר הזה הורחב לפחות פי מאה על ידי יצירת שאילתות ותרגילים בעזרת מודלים מותאמים, כולל שאילתות שליליות לצמצום הזיות.

מתאים ל

  • אימון מאפס של מודלים קטנים

    מתאים לבניית מודלי חשיבה של עד 350 מיליון פרמטרים בקצב אימון מהיר של 100 עד 200 מיליארד טוקנים.

  • כוונון יכולות הסקה

    טיוטות ההנמקה המובנות מאפשרות ללמד מודלים קיימים לפרק שאלות לשלבים לפני החזרת מענה.

  • מחקר על זיכרון במודלים

    בדיקת יכולות שליפה ושימור ידע מתוך קורפוס סינתטי מבוקר שמקורותיו מתועדים במדויק.

איפה זה נופל

אין כאן עברית בכלל. השפות מוגבלות לאנגלית, שמהווה כ־80% מהטקסט, ולעוד שבע שפות אירופיות בלבד: צרפתית, גרמנית, איטלקית, ספרדית, פולנית, הולנדית ולטינית. בנוסף, אין במאגר נתוני קוד, כך שהוא לא יעזור לפיתוח יכולות תכנות.

התרגילים והידע כוילו במכוון עבור מודלים קטנים של פחות מכמה מיליארדי פרמטרים, ולכן לא יתאימו לאימון מודלי ענק. המקורות משקפים הטיה מערבית מובהקת של קהילת עורכי ויקיפדיה באנגלית וארצות הברית, והמידע המעשי מוגבל כרגע בעיקר למתכוני בישול ולמדגם זעיר של 130 טקסטים עדכניים.

שאלות
נפוצות

האם המאגר כולל עברית?

לא, המאגר כולל כ־80% אנגלית והיתר בשבע שפות אירופיות בלבד: צרפתית, גרמנית, איטלקית, ספרדית, פולנית, הולנדית ולטינית. לפיתוח מודלים בעברית תצטרכו לחפש מקור אחר.

האם מותר להשתמש בו למוצרים מסחריים?

כן, הרישיון הוא cc-by-4.0 ומאפשר שימוש מסחרי מלא. תוכלו לאמן עליו מודלים פנימיים או מוצרים סגורים, כל עוד אתם נותנים קרדיט ליוצרים.

איך המידע הסינתטי נוצר?

הבסיס מגיע מכ־58,698 ערכי ויקיפדיה ודפי ויקיספר נבחרים שפורקו לפסקאות. מודלים ייעודיים יצרו סביבם שאילתות, תרגילי אריתמטיקה, כתיבה ושליפה עם שלבי נימוק מלאים, תוך הרחבת הידע המקורי בהיקף של פי מאה לפחות.

האם הוא מתאים לאימון מודלי קוד או מודלי ענק?

לא. המפתחים הוציאו לחלוטין נתוני תכנות וקוד מהמאגר, והתרגילים כוילו ברמת קושי שמתאימה רק למודלים קטנים של מתחת לכמה מיליארדי פרמטרים.

איך טוענים

המאגר מחולק ל־505 קובצי Parquet, כמו synth_001.parquet ומעלה, ואין צורך באישור גישה מיוחד כדי להוריד אותו. השדות העיקריים שמעניינים באימון הם synthetic_reasoning עבור נתיב החשיבה ו־synthetic_answer עבור הפלט הסופי, יחד עם query ו־constraints. עמודת exercise מגדירה את סוג המשימה כמו חשיבה, כתיבה יוצרת או אריתמטיקה, ו־language מציינת את השפה, מה שמאפשר לסנן בקלות תרגילים לפי צורך ספציפי.

from datasets import load_dataset

ds = load_dataset("PleIAs/SYNTH")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב שיתוף של תוצרים תחת אותו הרישיון, כך שמותר לאמן עליו מודלים מסחריים וסגורים. התנאי היחיד הוא מתן קרדיט נאות ליוצרים, PleIAs, בהתאם לדרישות הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗