GPT
P

Pretrain-Behaviors

קוד פתוח

IFMapache-2.02026-08-24

  • k2-horizon
  • training-data
  • parquet
  • pretraining
  • reasoning

טקסטים ממוקדי התנהגויות כמו הסקת מסקנות, תכנון, מדע נתונים ומשחקים. החומר מתאים למי שרוצה לאמן מודל שפה על יכולות חשיבה ספציפיות ולא רק על טקסט כללי מהרשת.

  • 9,198הורדות בחודש
  • 19לייקים

מה זה

המאגר מחולק לשבעה חלקים נפרדים לפי נושאים: הסקת מסקנות, תכנון, מדע נתונים, משחקים, שכתוב פורמטים, תוכן כללי, ותוכן נוסף. כל חלק יושב בתיקייה משלו ומכיל רשומות שהתחילו כאובייקטי JSON והומרו לקובצי Parquet מחולקים.

מבנה השדות והמידע הפנימי אינם אחידים ומשתנים בין החלקים השונים. הכרטיס לא מפרט אילו עמודות קיימות בכל חלק ודורש לבדוק את המבנה לפני שמתחילים לעבוד. גם תהליך האיסוף והסינון משתנה לפי החלק. הצוות מציין שחלק מהנתונים עברו ניקוי, סינון, הסרת כפילויות ודירוג איכות, בעוד שחלקים אחרים כוללים מידע סינתטי שנוצר במיוחד, ללא פירוט מדויק של היחס ביניהם.

מתאים ל

  • אימון יכולות הסקה

    שימוש בחלק ה־reasoning כדי לחזק יכולות פתרון בעיות וחשיבה שלבי מודלי שפה.

  • לימוד משימות תכנון

    אימון על תת-המאגר planning לצורך פירוק משימות מורכבות לצעדים מוגדרים.

  • שכתוב והמרת מבנים

    אימון מודלים על format-rewrites כדי לשפר המרה בין פורמטים ומבני טקסט שונים.

איפה זה נופל

הכרטיס מודה במפורש בקיומן של שגיאות עובדתיות, כפילויות, תוכן רגיש, סטריאוטיפים ותוכן שאינו בטוח. אין מידע על השפות שנכללות במאגר, כך שלא ברור אם יש בו טקסט בעברית או שהכל באנגלית.

בנוסף, הכרטיס מזכיר יצירת מידע סינתטי אך לא חושף איזה מודל יצר אותו או באילו חלקים הוא נמצא. חוסר התיעוד לגבי המקורות המדויקים והשדות השונים בכל חלק מחייב סינון ובדיקה ידנית לפני שמכניסים את החומר לאימון של מודל לייצור.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

כן, הרישיון הוא Apache 2.0 והוא מתיר שימוש מסחרי מלא. צריך לשמור על תנאי הייחוס ולצרף את נוסח הרישיון. המודל שאתם מאמנים עליו יכול להישאר קוד סגור.

האם המאגר כולל תוכן בעברית?

כרטיס הדאטהסט לא מציין באילו שפות הטקסט כתוב. רוב הסיכויים שמדובר בעיקר באנגלית, ולכן צריך לבדוק דגימה מתוך הקבצים לפני שבונים עליו לעברית.

איך הנתונים נאספו ונבנו?

התיעוד מפרט שהנתונים נאספו ממקורות שונים ועברו המרה מקובצי JSON לפורמט Parquet. חלק מהחומר עבר סינון, ניקוי והסרת כפילויות, וחלקו כולל מידע סינתטי, אך אין פירוט ספציפי לגבי מקורות הנתונים עצמם.

האם אפשר להוריד רק נושא אחד בלי כל השאר?

כן, המאגר בנוי מתתי-מאגרים עצמאיים כמו games, planning או reasoning. אפשר להגדיר בטעינה רק את החלק הרלוונטי או להזרים אותו ישירות בלי להוריד את כל 4,167 הקבצים.

איך טוענים

טוענים את המידע ישירות באמצעות ספריית datasets על ידי ציון שם החלק הספציפי שרוצים, למשל reasoning או planning. אין צורך באישור גישה מיוחד, המאגר פתוח לחלוטין.

במאגר יש 4,167 קבצים בסך הכל. בגלל הגודל והחלוקה לרסיסים מרובים, מומלץ לעבוד במצב streaming ולא להוריד הכל בבת אחת. לפני שרצים על הנתונים, צריך לבדוק את features של החלק הנבחר כדי לראות אילו שדות קיימים בו בפועל.

from datasets import load_dataset

ds = load_dataset("IFM/Pretrain-Behaviors")

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש במידע למטרות מסחריות ולמחקר, לשנות אותו ולהפיץ אותו. חובה לתת קרדיט למפרסמים ולצרף עותק של הרישיון. אין חובה לשתף את המודל המאומן או את הנגזרות תחת אותו רישיון, ומותר לשלב את החומר במוצרים סגורים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗