GPT
C

claude-opus-4.6-4.7-reasoning-8.7k

קוד פתוח

angrygiraffeapache-2.02026-05-01

  • sft
  • chain-of-thought
  • coding
  • math
  • roleplay

8,706 שיחות סינתטיות שנוצרו על ידי קלוד אופוס עם בלוקי מחשבה מובנים. הוא מתאים למי שרוצה לאמן מודל להפגין שיקול דעת מעמיק לפני מתן תשובה ולא רק לפלוט טקסט ישיר.

  • 1,211הורדות בחודש
  • 444לייקים

מה זה

המאגר מכיל 8,706 דוגמאות אימון בפורמט צ'אט, בהיקף של כ־17 מיליון טוקנים. הנתונים מחולקים ל־28 קטגוריות שונות, כאשר המרכזיות בהן הן קוד (1,628 דוגמאות), מדעי הרוח ומדעים כלליים, לצד תחומי מומחיות ספציפיים כמו רפואה, משפטים ומשחקי תפקידים. כמעט 40% מהדוגמאות כוללות שיחות מרובות תורות, והשאר מורכבות משאלה ותשובה בודדות.

כל המידע סינתטי לחלוטין ונוצר באמצעות Claude Opus 4.6 ו־4.7, ללא בדיקה או סינון אנושי ידני. המפתח יצר בלוקי חשיבה מלאכותיים בתחילת כל תשובת עוזר, שנעים בין 150 ל־500 מילים, ומדמים תכנון ושיקול דעת. יש במאגר גם קבצים מקבילים שמסירים את בלוק החשיבה למי שמעדיף אימון רגיל, וכן חלוקות משנה ייעודיות לקוד, הוראות כלליות ומשחקי תפקידים.

מתאים ל

  • אימון שרשרת חשיבה

    לימוד מודלי שפה לייצר תהליך חשיבה פנימי מפורט בתוך תגיות ייעודיות לפני הפקת התשובה.

  • כוונון למשימות קוד ומתמטיקה

    שימוש בקובץ code_train המבודד 1,840 דוגמאות ממוקדות בפתרון באגים, ארכיטקטורה וחישובים.

  • אימון דמויות ומשחקי תפקידים

    הטמעת סגנונות כתיבה ספרותיים מורכבים ועקביים דרך 1,489 שיחות מותאמות אישית.

איפה זה נופל

היוצר מציין במפורש שהדאטהסט לא עבר בדיקה אנושית, כך ששגיאות והזיות של קלוד עברו פנימה ללא בקרה. בנוסף, כל הטקסט באנגלית בלבד ואין בו שום ייצוג לעברית. בלוק החשיבה אינו תהליך ההסקה האמיתי של המודל אלא טקסט סינתטי שנוצר בדיעבד כדי לחקות חשיבה. הוצאו ממנו באופן מכוון סירובים והנחיות בטיחות, כך שהוא לא מלמד את המודל שלכם מתי לשתוק.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לאימון מודל מסחרי?

הרישיון הרשמי בעמוד הוא Apache 2.0, שמתיר שימוש מסחרי מלא. עם זאת, התוכן כולו נוצר על ידי קלוד של אנתרופיק, ותנאי השימוש שלהם אוסרים על אימון מודלים מתחרים. היוצר עצמו מזכיר לכבד את תנאי החברה, כך שהאחריות המשפטית נשארת עליכם.

האם יש בדאטהסט תוכן בעברית?

לא. הדאטהסט כולו באנגלית. אם המטרה היא שיפור יכולות בעברית, תצטרכו לתרגם את הנתונים או לפנות למקורות אחרים.

איך נאספו הנתונים?

היוצר הריץ פרומפטים מול מודלי Claude Opus 4.6 ו־4.7 במסגרת מנוי אישי, כשהוא מגדיר אלפי פרומפטים שונים של מערכת. התהליך התפתח לאורך זמן וללא סינון אנושי ידני על התוצאות שהתקבלו.

מה המשמעות של גרסאות ה־no_reasoning במאגר?

היוצר יצר גרסאות מקבילות שבהן הוסרו תגיות ה־think. זה מאפשר להשתמש באותן שיחות בדיוק לצורך אימון הוראות רגיל, בלי להכריח את המודל שלכם להפיק פסקאות מחשבה ארוכות לפני כל מענה.

איך טוענים

הנתונים מגיעים בקובצי JSONL סטנדרטיים של OpenAI, נגישים להורדה ישירה ללא צורך באישור מיוחד. כל שורה מכילה מערך messages לצד שדות category ו־model. מי שמכוון רק לאימון יכול להתעלם משדות המטא-דאטה, אך כדאי לשים לב לבחירת הקובץ הנכון: full_train.jsonl כולל את תגיות החשיבה, בעוד גרסאות ה־no_reasoning מנקות אותן מראש.

from datasets import load_dataset

ds = load_dataset("angrygiraffe/claude-opus-4.6-4.7-reasoning-8.7k")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0, שמאפשר שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. עם זאת, היוצר מזהיר לכבד את תנאי השימוש של Anthropic, דבר שיוצר אי-ודאות סביב שימוש בפלט של קלוד לאימון מודלים מסחריים מתחרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗