GPT
T

TxT360-3efforts

קוד פתוח

IFMcc-by-4.02025-12-05

מאגר לאימון SFT שמלמד מודלים להתאים את עומק המחשבה לשלוש רמות שונות. הוא מכיל כעשרה מיליון מסמכים שנאספו ממקורות חופשיים ועובדו מחדש.

  • 5,401הורדות בחודש
  • 113לייקים

מה זה

המאגר מרכז שאלות ממגוון רחב של מקורות ציבוריים ופתוחים, לצד שאלות סינתטיות. היוצרים סיננו החוצה מידע שנוצר במקור על ידי מודלים מסחריים כמו סדרת GPT, מחקו כפילויות וביצעו ניקוי מול מבחני ביצועים מקובלים כדי למנוע דליפת נתונים. רוב התשובות נוצרו מחדש באמצעות המודל GPT-OSS-120B בשלוש רמות השקעה שונות, נמוכה, בינונית וגבוהה, במטרה לאפשר שליטה באורך החשיבה ובאיכות הפלט דרך תבנית השיחה.

התוכן מחולק לתשע קטגוריות ראשיות. התחום המתמטי כולל שאלות ממספר מאגרים ודיאלוגים מרובי שלבים המדמים מורה ותלמיד. תחום הקוד כולל פייתון, SQL ופיתוח ב־React. בנוסף ישנם נתונים לשיחה כללית, מדעי ה־STEM, מעקב אחר הוראות מורכבות עם אילוצים שניתן לאמת אוטומטית, נתיבי הפעלת כלים המותאמים למבנה של MCP, הגדרת זהות עצמית של המודל ובטיחות הכוללת ניסיונות עקיפת הגנות שנוצרו בעזרת PyRIT.

מתאים ל

  • אימון מודל חושב

    אימון מודל להגיב ברמות העמקה משתנות לפי בחירה בתבנית הפנייה.

  • פיתוח סוכני קוד

    לימוד הפעלת כלים וביצוע פקודות לפי תקן MCP מתוך דוגמאות מובנות.

  • בדיקות חסינות והגנה

    אימון ושיפור מודלים מול ניסיונות עקיפה ופריצה מגוונים בתחום הבטיחות.

איפה זה נופל

התשובות מבוססות בעיקר על מודל סינתטי יחיד, GPT-OSS-120B. למרות הסינון, שימוש במודל אחד ליצירת רוב הפלטים עלול לקבע דפוסי ניסוח מסוימים. מבחינת שפות, הרוב המוחלט באנגלית. תחום הזהות העצמית כולל תת-מאגר קטן בלבד של עשר שפות עם 300 זוגות שאלות ותשובות לכל שפה, כך שאין כאן מענה למי שמחפש אימון נרחב בעברית. בנוסף, נתוני הזהות העצמית משלבים פרומפט מערכת ייעודי בחלק מהדגימות, ויש לבודד אותו כדי שהמודל המאומן לא יאמץ זהות שאינה מתאימה למוצר שלכם.

שאלות
נפוצות

האם המאגר מתאים לפיתוח מסחרי?

כן, הרישיון הוא CC BY 4.0 שמתיר שימוש מסחרי מלא. הדרישה העיקרית היא מתן קרדיט מתאים ליוצרים המקוריים.

האם יש במאגר תמיכה בעברית?

החומרים הם בעיקרם באנגלית. ישנו מקטע קטן בתחום הזהות העצמית עם עשר שפות, אך הכרטיס אינו מציין במפורש עברית ולכן לא כדאי להסתמך עליו לאימון בשפה זו.

מאיפה נאספו השאלות והתשובות?

השאלות לוקטו מעשרות מאגרי קוד פתוח ידועים כמו Nemotron, MathQA ו־UltraChat. התשובות עברו סינון קפדני ונוצרו ברובן מחדש באמצעות המודל הפתוח GPT-OSS-120B.

מה המשמעות של שלוש רמות המאמץ?

כל רמה מייצגת אורך מחשבה ועומק פתרון שונה, מנמוך ועד גבוה. זה מאפשר לכוון את התנהגות המודל בזמן ריצה לפי מורכבות הבעיה והמשאבים הזמינים.

איך טוענים

הנתונים מחולקים ל־160 קבצי Parquet לפי תחומים, כמו סוכן ורמות מאמץ. אין צורך בבקשת גישה מיוחדת, המאגר פתוח להורדה ישירה דרך Hugging Face. היקף החומר כולל כעשרה מיליארד טוקנים לאימון, כאשר כ־98 אחוזים מהרשומות קצרות מ־8,000 טוקנים. שיחות מרובות תורות פוצלו לדגימות נפרדות שכוללות את כל ההקשר הקודם.

from datasets import load_dataset

ds = load_dataset("IFM/TxT360-3efforts")

הרישיון

המאגר מופץ תחת רישיון CC BY 4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, כל עוד ניתן קרדיט הולם ליוצרים ומצוין קישור לתנאי הרישיון. אין חובה לשתף נגזרות באותו הרישיון, מה שמאפשר לאמן ולהפיץ מודלים מסחריים סגורים על בסיס המידע הזה.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗