GPT
C

claude_mythos_distilled_25k

קוד פתוח

WithinUsAIapache-2.02026-05-14

  • synthetic
  • claude
  • mythos
  • distillation
  • cybersecurity

מאגר אימון סינתטי שמיועד למי שרוצה להקנות למודל פתוח סגנון חשיבה טכני, התנהגות סוכנית ודגש כבד על סייבר והנדסת תוכנה. הוא מנסה לחקות פלט של מודל קצה בלי גישה ישירה אליו.

  • 976הורדות בחודש
  • 178לייקים

מה זה

המאגר מכיל 25,000 שיחות בפורמט צ'אט עם מטא-דאטה, בהיקף של כ־12 עד 15 מיליון תוקנים. התוכן סינתטי לחלוטין ונוצר במאי 2026 באמצעות מנוע חיצוני כדי לחקות את סגנון ההסקה של קלוד מיתוס, ולא מדובר בפלטים מקוריים של אנתרופיק.

החלוקה הפנימית מורכבת משישה תחומים ברורים. הנתח המרכזי כולל 7,000 רשומות של סייבר ובדיקות חדירה הגנתיות, 5,500 דוגמאות של פיתוח תוכנה מתקדם, 3,500 דוגמאות לתכנון סוכני ומשימות מורכבות, ועוד 3,500 שאלות ותשובות מומחה על ממשל ויישור מודלים. שאר הדוגמאות מתחלקות בין חשיבה מתמטית ולוגית עם 3,000 רשומות, וניתוח מדעי עם 2,500 רשומות.

מתאים ל

  • אימון מודל סייבר הגנתי

    כוונון מודלי שפה על 7,000 דוגמאות של ניתוח חולשות, זיהוי איומים והתגוננות.

  • פיתוח סוכנים אוטונומיים

    הקניית יכולות תכנון לטווח ארוך ופתרון בעיות מורכבות למודלים בקוד פתוח.

  • אימון תכנות מתקדם

    שיפור ביצועי כתיבת קוד במערכות עם ביצועים גבוהים ודרישות אבטחה מחמירות.

איפה זה נופל

זהו דאטהסט סינתטי לחלוטין שנוצר על ידי מנוע חיצוני כפרשנות לסגנון מסוים, ולכן הוא סובל מהטיות של המודל שיצר אותו. כל הדוגמאות הן באנגלית בלבד ואין פה מילה אחת בעברית. תרחישי הסייבר תאורטיים ואינם מכילים חולשות אבטחה אמיתיות או קוד תקיפה שמיש. אם אתם בונים מודל לשימוש מעשי, אי אפשר להסתמך עליו לבד ותצטרכו לשלב אותו עם נתוני העדפת אנושיים ודאטה איכותי מהעולם האמיתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן. רישיון Apache 2.0 מאפשר שימוש מסחרי מלא, כולל אימון מודלים שתמכרו או תנגישו בתשלום. הדרישה העיקרית היא הוספת ייחוס ליוצר המקורי.

האם הדאטהסט כולל עברית?

לא. כל 25,000 הדוגמאות כתובות באנגלית בלבד. אם המטרה היא מודל שיפעל בעברית, תצטרכו לתרגם את הנתונים או להוסיף מקורות מקומיים.

מאיפה הגיעו הנתונים שבמאגר?

הנתונים נוצרו באופן סינתטי לחלוטין במאי 2026 בעזרת סקריפט ומודל מחולל. הם לא נאספו מאנתרופיק ולא מייצגים פלט ישיר מקלוד מיתוס.

כמה המאגר שוקל והאם הוא כבד להורדה?

הקובץ שוקל 52.6 מגה-בייט בלבד בפורמט JSONL. הוא מכיל 25,000 רשומות וקל מאוד להוריד ולטעון אותו לכל סביבת עבודה מקומית או בענן.

איך טוענים

טוענים את קובץ ה־JSONL ישירות דרך ספריית datasets באמצעות פקודת load_dataset רגילה. הקובץ המרכזי שוקל כ־52.6 מגה-בייט, הגישה פתוחה ואין צורך באישור מוקדם. הרשומות מגיעות בעמודת messages שמתאימה מיד לכלים כמו TRL או Axolotl, וההמלצה בכרטיס היא לאמן לא יותר מסיבוב או שניים באורך הקשר של 8,192 עד 32,768 תוקנים תוך חישוב לוס על תשובות המודל בלבד.

from datasets import load_dataset

ds = load_dataset("WithinUsAI/claude_mythos_distilled_25k")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0 המאפשר שימוש מחקרי ומסחרי חופשי, כולל אימון מודלים נגזרים. אין חובת שיתוף תחת אותו רישיון עבור המודל שאימנתם, אך נדרש לתת ייחוס הולם ליוצרי המאגר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗