GPT
A

AM-DeepSeek-Distilled-40M

קוד פתוח

a-m-teamcc-by-nc-4.02025-04-18

  • code
  • math
  • science
  • instruction follow
  • reasoning

המאגר מרכז כארבעים מיליון תשובות מנומקות לשלושה מיליון שאלות, עם ציוני הצלחה לפי גודל המודל. הוא מתאים למי שרוצה לסנן נתוני אימון מבוססי הסקה לפי רמת קושי אמיתית ולא לפי הערכות גנריות.

  • 4,332הורדות בחודש
  • 56לייקים

מה זה

הנתונים נשענים על כ־3.34 מיליון שאלות ייחודיות שנאספו משלושים מקורות פתוחים מוכרים, ביניהם OpenHermes-2.5, NuminaMath ו־tulu-3-sft-mixture. כל שאלה נבדקה מול שלושה מודלים: DeepSeek-R1-Distill-Qwen-1.5B, DeepSeek-R1-Distill-Qwen-7B ו־DeepSeek-R1 המלא, כאשר כל אחד מהם יצר ארבע תשובות שונות. המבנה הזה מייצר שתים עשרה תשובות לכל שאלה מקורית, ובסך הכל כארבעים מיליון רשומות.

התוכן מחולק לחמש קטגוריות מרכזיות: מתמטיקה עם מעל 828 אלף שאלות, קוד עם כ־489 אלף, מדעים, מילוי הוראות, וקטגוריית שונות שכוללת מעל 1.85 מיליון שאלות של חשיבה כללית. עבור קוד ומתמטיקה בוצע אימות קפדני באמצעות הרצה בסביבת בדיקה מבודדת או ספריות אימות מתמטיות, בעוד שבתחומים הכלליים יותר נעשה שימוש במודל שופט לקביעת ציוני איכות.

מתאים ל

  • אימון SFT מבוסס קושי

    סינון תשובות נכונות של מודלים קטנים לשאלות פשוטות ותשובות של R1 לשאלות קשות.

  • למידת העדפות DPO

    יצירת זוגות של תשובה נכונה מול שגויה לאותה שאלה על בסיס ציוני ה־verify.

  • אימון תגמול ל־RL

    שימוש במדדי המעבר והאימות כדי לכוונן מודל שמעריך נכונות של צעדי חשיבה.

איפה זה נופל

היוצרים מודים במפורש בחלק מתגיות ה־ground_truth שאינן מדויקות, עובדה שמשפיעה ישירות על אמינות מדדי ההצלחה והאימות. השאלות חוזרות שתים עשרה פעמים עם תשובות שונות, כך שאימון ישיר בלי סינון או דה-דופליקציה יוביל להתאמת יתר חריפה. הנתונים קיימים באנגלית ובסינית בלבד, ואין כאן עברית כלל. מעבר לזה, הכרטיס מציין שמדובר בתת-קבוצה מתוך מאגר מלא שנשמר אצל החוקרים.

שאלות
נפוצות

האם אפשר להשתמש בדאטהסט לפיתוח מוצר מסחרי בישראל?

לא. הרישיון הוא cc-by-nc-4.0 והיוצרים מדגישים בפירוש שהחומרים מיועדים למחקר בלבד. אסור לשלב אותו באימון מודלים שנמכרים כשירות או פועלים בתוך מוצר מסחרי.

האם יש במאגר שאלות או תשובות בעברית?

המאגר כולל אנגלית וסינית בלבד לפי הדיווח הרשמי. מי שבונה מודלים שמיועדים לשפה העברית יצטרך לתרגם את הנתונים בעצמו או להשתמש בהם רק עבור משימות קוד ומתמטיקה שאינן תלויות שפה.

איך נמדדה רמת הקושי של השאלות?

במקום להסתמך על הערכת קושי סובייקטיבית של מודל יחיד, המפתחים הריצו ארבע דגימות בכל אחד משלושה גדלי מודלים. שיעור ההצלחה היחסי בפועל קבע את רמת הקושי של כל משימה.

למה מופיעות כל כך הרבה שאלות כפולות בקבצים?

כל אחת מ־3.34 מיליון השאלות נדגמה ארבע פעמים בכל אחד משלושת המודלים, מה שמייצר שתים עשרה רשומות לאותה שאלה בדיוק. אם מאמנים בלי לקבץ לפי שאלות, המודל ייחשף לאותו ניסוח מספר רב של פעמים.

איך טוענים

המאגר כולל 64 קבצים בפורמט jsonl, המחולקים לפי קטגוריות תוכן ומודלים. אין צורך באישור גישה מיוחד כדי להוריד אותו, אבל בגלל היקף הנתונים מומלץ לסנן את הקבצים לפני הטעינה במקום למשוך הכל ישירות לזיכרון. שדות המפתח כוללים את question, את התשובה answer, תגיות המקור, שדות ground_truth, ומדדי pass_rate שונים לצד verify_score שמאפשרים לחתוך רק דוגמאות שעברו אימות בהצלחה.

from datasets import load_dataset

ds = load_dataset("a-m-team/AM-DeepSeek-Distilled-40M")

הרישיון

הרישיון הוא cc-by-nc-4.0 ומחייב שימוש לא מסחרי בלבד יחד עם מתן ייחוס ליוצרים. המפרסמים אוסרים במפורש שימוש מסחרי מכל סוג, ולכן מודל שתאמנו על הנתונים הללו לא יוכל לשמש מוצר מסחרי, שירות בתשלום או פעילות עסקית בחברה שלכם.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗