GPT
G

GPT-5.5-Gemini-3.1-Pro-Grok-4-Claude-Fable-5-Mythos-5-Qwen-3.7-Max-and-more-Distillation-Dataset

קוד פתוח

Manusagentsmit2026-07-01

  • distillation
  • instruction-tuning
  • sft
  • reasoning
  • coding

המאגר מרכז מעל 18 מיליון דוגמאות אימון מזיקוק של מודלים מובילים ומאגרי קוד. הוא מיועד למי שבונה סוכני תכנות, כלי סייבר או מודלים מבוססי הנמקה.

  • 18,765הורדות בחודש
  • 193לייקים

מה זה

המאגר מאגד 73 מקורות שונים שחולקו לשמונה קטגוריות מרכזיות, ביניהן תכנות, מדע, סייבר, מדעי הרוח ומודלים מזוקקים. הנתונים מורכבים משיחות מובנות, עקבות הנמקה, תיעוד פקודות ושאילתות טכניות, לצד עשרות אלפי דוגמאות בתחומי מדע מדויק והנדסה. רוב המידע מגיע מעקבות של מודלים מסחריים כמו קלוד, גרוק ומשפחת ג'מיני, שעברו עיבוד אחיד לפני שהוכנסו למערך.

חלק הארי של המאגר מוקדש לתכנות וכולל מעל 11 מיליון דוגמאות שמקורן ביומני ריצה של סוכנים אוטומטיים ומאגרי גיטהאב. לצד הטקסט המזוקק, נכלל ארכיון של 7,090 מאגרי קוד מקור דחוסים, שנועדו לשמש כחומר גלם לאימון מקדים. קטגוריית הסייבר תופסת נפח נפרד עם נתוני התקפה והגנה, תרחישי צוות אדום מול כחול, ניתוח חולשות מוכרות ותרשימי תקיפת רשת.

מתאים ל

  • אימון סוכני תכנות

    שימוש בעקבות ריצה ופתרון תקלות של סוכני קוד מרובי שלבים כדי לשפר את יכולת הביצוע של המודל.

  • פיתוח כלי סייבר

    לימוד זיהוי חולשות, כתיבת תסריטי הגנה ותרגול תרחישי תקיפה מול נתוני אבטחה מובנים.

  • חידוד מודלי שיחה והנמקה

    כוונון עדין על שרשראות חשיבה ותשובות מפורטות בתחומי מדע מדויק והנדסה.

איפה זה נופל

חלק גדול מהתוכן מבוסס על פלטים סינתטיים של מודלים מסחריים, מה שגורר הטיות מובנות, הזיות ואי אחידות באיכות התשובות. קטגוריית הסייבר כוללת פקודות תקיפה, קודי פריצה והסברים על ניצול חולשות, מה שעלול לייצר סיכוני אבטחה או להכשיל בדיקות בטיחות של המודל אם לא מבצעים סינון מקדים. השפה השלטת היא אנגלית כמעט בלעדית, והתיעוד לא מפרט תמיכה אמיתית בעברית למעט תיוג כללי כרב-לשוני.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

הרישיון הרשמי הוא MIT ולכן הוא מתיר שימוש מסחרי חופשי. הקושי נובע מכך שהנתונים כוללים זיקוקים מפלטפורמות סגורות שתנאי השימוש שלהן מגבילים אימון מודלים מתחרים, ויש לקחת בחשבון את הסיכון המשפטי הזה.

כמה מקום בדיסק צריך כדי להוריד את המאגר?

המאגר שוקל מעל 76 גיגהבייט בצורתו הדחוסה. אם פורסים את כל קובצי הארכיון של מאגרי הגיטהאב, הנפח יעבור את רף ה־200 גיגהבייט.

האם יש במאגר נתונים בעברית?

התיעוד מגדיר את המאגר כרב-לשוני אך אין בו פירוט לגבי עברית, ועיקר הדוגמאות והקוד כתובים באנגלית. לא הייתי בונה עליו לאימון מודל שמיועד לשפה העברית ללא בדיקה יזומה של הדגימות.

איך המידע במאגר נאסף?

היוצרים איחדו נתונים מ־73 מאגרים קיימים ברשת והעבירו אותם תהליך עיבוד אחיד. החומרים מגיעים ממודלים של חברות שונות, ממאגרי גיטהאב ציבוריים ומאוספי נתונים מדעיים.

איך טוענים

טוענים את הנתונים דרך ספריית datasets באמצעות פקודת load_dataset ישירות מהמאגר הציבורי, ללא צורך באישור גישה או מפתח מיוחד. בגלל המשקל הכולל של מעל 76 גיגהבייט ו־516 קובצי JSONL, מומלץ להפעיל streaming או להגדיר נתיב ספציפי לתיקייה או לקטגוריה הרצויה. השדות העיקריים בטקסט הם instruction ו־response. אם מתכננים לעבוד על קוד מלא מהארכיון הדחוס בנפח 64 גיגהבייט, צריך לקחת בחשבון פריסה שתעלה על 200 גיגהבייט בדיסק המקומי.

from datasets import load_dataset

ds = load_dataset("Manusagents/GPT-5.5-Gemini-3.1-Pro-Grok-4-Claude-Fable-5-Mythos-5-Qwen-3.7-Max-and-more-Distillation-Dataset")

הרישיון

המאגר מופץ תחת רישיון MIT שמתיר שימוש מסחרי, שינוי והפצה מחדש כמעט ללא הגבלות, למעט חובת ייחוס. עם זאת, החומרים נאספו מ־73 מקורות שונים ומבוססים בחלקם הגדול על פלטים של מודלים סגורים. תנאי השימוש של חלק מאותם ספקי מודלים אוסרים על שימוש בפלטים שלהם לצורך אימון מודלים מתחרים, ולכן תאימות הרישיון למוצר מסחרי דורשת בדיקה משפטית זהירה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗