GPT
O

Opus-4.6-Reasoning-3300x

קוד פתוח

Crowneliusapache-2.02026-02-12

המאגר מרכז 2,160 דוגמאות חשיבה ופתרון בעיות שנוצרו באמצעות המודל Claude Opus 4.6. הוא מתאים למי שמחפש דאטה מזוקק ומסונן לאימון מודלי היסק בלי לשלם על יצירת הפלטים בעצמו.

  • 781הורדות בחודש
  • 323לייקים

מה זה

הנתונים כוללים שאלות, שלבי חשיבה ופתרונות סופיים שנוצרו במקור בהיקף של 3,305 שורות. היוצר סינן החוצה 1,145 רשומות, שהן 34.6 אחוז מהחומר הגולמי, בעזרת ניקוי אוטומטי שהסיר סירובים לפתור, שאלות חלקיות, פלטים ריקים ורשומות קצרות מדי.

המבנה הפנימי מכיל שמונה עמודות: מזהה, השאלה, שדה החשיבה, הפתרון, רמת הקושי, קטגוריה, חותמת זמן ומחרוזת גיבוב. כל רשומה מייצגת פנייה בודדת של שאלה ותשובה ללא שימוש בכלים חיצוניים, עם ממוצע של כמעט 758 טוקנים לשורה ובסך הכל מעל 1.6 מיליון טוקנים של פלט.

מתאים ל

  • זיקוק מודלי היסק

    אימון מודלים קטנים יותר על שרשראות החשיבה של המודל הגדול כדי לשפר יכולת פתרון של בעיות מורכבות.

  • אימון הוראות עם חשיבה

    הזנת דוגמאות של בעיה, מחשבה מוקדמת ותשובה סופית למודל כדי ללמד אותו לייצר שלב thinking לפני המענה.

  • בדיקת איכות פתרונות

    שימוש ברשומות המסוננות כסט בדיקה פנימי להשוואת ביצועי היסק של מודלים מול הפלטים של Opus.

איפה זה נופל

הסינון היה טכני ואוטומטי לחלוטין, כך שאין בדיקה אנושית שמאמתת את נכונות הפתרונות או איכות החשיבה. 33 אחוז מהחומר המקורי נזרק בגלל סירובים של המודל או בעיות לא שלמות, מה שמעיד על איכות בעייתית בחלק מהקלט המקורי. בנוסף, הכרטיס לא מפרט באילו שפות מדובר, מה מקור הבעיות עצמן, או אילו נושאים מכסות הקטגוריות, ולכן חובה לדגום את התוכן ידנית לפני שמריצים אימון.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

ברמת הרישיון הישיר של המאגר מוגדר apache-2.0 שמתיר שימוש מסחרי מלא. מצד שני, הנתונים הם סינתטיים ונוצרו על ידי Claude Opus 4.6. במקרים מסוימים תנאי השימוש של יוצרי המודל המקורי מגבילים אימון של מודלים מסחריים מתחרים, ולכן האחריות המשפטית עליכם.

כמה שוקל המאגר ואיך מקבלים אליו גישה?

המאגר זמין לציבור ללא צורך בהרשמה מיוחדת או בקשת אישור. כל המידע שמור בקובץ Parquet יחיד שכולל 2,160 שורות, כך שמדובר בקובץ קטן מאוד שיורד תוך שניות בודדות.

האם הדאטהסט מתאים לעבודה בעברית?

התיעוד לא מזכיר תמיכה בעברית או את שפת השאלות. לפי הדוגמאות וההגדרות בכרטיס המאגר באנגלית. אם אתם צריכים דאטה לאימון בעברית, תצטרכו לתרגם את השאלות והפתרונות או לחפש מקור אחר.

איך אספו את המידע ואיך ניקו אותו?

היוצר הריץ 3,305 שאלות מול המודל דרך OpenRouter בעלות של כ־409 דולר. לאחר הריצה הופעל סינון אוטומטי שהוריד 1,145 שורות של סירובים, בעיות חלקיות ותשובות קצרות או ריקות, מה שהשאיר 2,160 דוגמאות נקיות.

איך טוענים

אתם מושכים את הקובץ ישירות דרך הספרייה datasets של Hugging Face בפקודת load_dataset רגילה שמצביעה על split בשם train. הגישה פתוחה לחלוטין ללא צורך באישור מיוחד. כל המידע יושב בקובץ Parquet יחיד בתיקיית data, והשדות העיקריים שתעבדו איתם באימון הם problem, thinking ו־solution.

from datasets import load_dataset

ds = load_dataset("Crownelius/Opus-4.6-Reasoning-3300x")

הרישיון

המאגר מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי והפצה, כל עוד אתם מצרפים קרדיט ומציינים שינויים שביצעתם. עם זאת, התוכן נוצר באמצעות Claude דרך OpenRouter, ולכן כדאי לבדוק את תנאי השימוש של ספק המודל בנוגע לאימון מודלים מתחרים על גבי פלטים שלו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗