GPT
R

reasoning-distill-claude-opus-4-7-max

קוד פתוח

lordx64apache-2.02026-04-18

  • reasoning
  • chain-of-thought
  • distillation
  • claude
  • opus-4-7

מאגר של שרשראות חשיבה ותשובות שהופקו כולן ממודל קלוד אופוס 4.7. הוא מיועד למי שמחפש דאטה סינתטי באיכות גבוהה כדי לזקק יכולות נימוק למודלי קוד פתוח.

  • 443הורדות בחודש
  • 56לייקים

מה זה

המאגר מכיל 8,124 שיחות מלאות, כשבכל רשומה יש את הפרומפט, שרשרת החשיבה המורחבת של המודל, והתשובה הסופית שלו. היוצר לקח רק את שאלות המשתמש מתוך שבעה מאגרים קיימים, ביניהם אוספים של טיכאיי ומאגר להסקה פיזיקלית, זרק לחלוטין את התשובות המקוריות שלהם, והריץ הכל מחדש דרך ממשק ה־Batch הרשמי של אנתרופיק עם מודל אופוס 4.7.

המבנה של הנתונים שומר על שקיפות מלאה לגבי המקור של כל שאלה. בכל שורה תמצאו את המזהה של מאגר המקור, מזהה השורה המקורי, הודעות המשתמש, שרשרת המחשבה, הפלט הסופי, סיבת העצירה ופירוט צריכת הטוקנים המקורי מה־API.

מתאים ל

  • זיקוק יכולות חשיבה למודלים

    אימון מודלי קוד פתוח קטנים לחשוב צעד אחר צעד על בסיס שרשראות החשיבה של אופוס 4.7.

  • ניתוח עומק של תהליכי הסקה

    חקר האופן שבו המודל מפרק בעיות מורכבות ומדעיות דרך שדה ה־thinking המלא.

  • אימון SFT למודלי צ'אט

    בניית סט נתונים ייעודי לכוונון מודלים על תשובות מנומקות במבנה שיחה רב שלבי.

איפה זה נופל

המאגר כולו באנגלית ואין בו שום ייצוג לעברית. בנוסף, מדובר בדאטה סינתטי לגמרי שמבוסס כולו על פלטים של מודל יחיד, ללא סינון ידני או אימות עובדתי של התוצאות, כך שהטיות או הזיות של אופוס 4.7 נכנסו ישירות פנימה. מי שבונה מודל שמיועד להתחרות ישירות באנתרופיק צריך לבדוק היטב את תנאי השימוש שלהם.

שאלות
נפוצות

האם המאגר כולל עברית?

לא. הנתונים מתועדים באנגלית בלבד. אם המטרה שלכם היא מודל שיודע לנמק בעברית, תצטרכו לתרגם את השאלות ולייצר שרשראות חשיבה מחדש, או להשתמש בו לאימון כללי בלבד.

מותר להשתמש בזה למטרות מסחריות?

הרישיון המוצהר במאגר הוא אפאצ'י 2.0, אבל התוכן נוצר באמצעות ה־API של אנתרופיק. המשמעות היא שאתם כפופים למדיניות השימוש של אנתרופיק, שאוסרת בדרך כלל על אימון מודלים שמתחרים בהם ישירות.

האם התשובות כאן הן של מודלים ישנים כמו אופוס 4.6 או סונט?

לא. הפרומפטים בלבד נלקחו ממאגרים שנבנו במקור עבור מודלים קודמים, אך כל התשובות ושרשראות החשיבה במאגר הופקו מחדש במלואן על ידי קלוד אופוס 4.7. התשובות הישנות נמחקו לגמרי ולא נכללו כאן.

כמה שוקל הדאטה ואיך הוא מחולק?

המאגר כולל 8,124 רשומות ומאוחסן בקובץ parquet יחיד תחת חלוקת train בלבד. אין חלוקה מובנית לסט בדיקה או אימות, כך שתצטרכו לפצל אותו בעצמכם לפני תחילת האימון.

איך טוענים

טוענים את המאגר ישירות בספריית datasets עם הקריאה load_dataset על השם lordx64/reasoning-distill-claude-opus-4-7-max וחלוקת train. הגישה פתוחה לגמרי ללא צורך באישור, והכל יושב בקובץ parquet יחיד. השדות המרכזיים לעבודה הם messages, thinking ו־response, לצד שדה usage שמאפשר לראות כמה טוקנים הושקעו בכל מחשבה ותשובה.

from datasets import load_dataset

ds = load_dataset("lordx64/reasoning-distill-claude-opus-4-7-max")

הרישיון

האריזה והקוד משוחררים תחת רישיון אפאצ'י 2.0, שמאפשר שימוש מסחרי, שינוי והפצה ללא דרישה להדביק את אותו הרישיון הלאה. יחד עם זאת, התוכן עצמו הופק מה־API של אנתרופיק וכפוף למדיניות השימוש שלהם, מה שעשוי להגביל אימון מודלים מסחריים מתחרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗