GPT
C

claude-sonnet-4.6-120000x

קוד פתוח

Roman1111111רישיון לא דווח2026-04-19

מעל 120 אלף רשומות חשיבה סינתטיות שנוצרו עם שרשראות חשיבה ללא סינון. המאגר נותן מענה למי שרוצה לאמן מודלים על פתרון בעיות מורכבות בקוד, מתמטיקה והסקה לוגית בלי סירובים מובנים.

  • 431הורדות בחודש
  • 83לייקים

מה זה

המאגר מורכב משני חלקים עיקריים שכוללים יחד מעל 122 אלף שורות. החלק הראשון מכיל 90,207 רשומות של ידע כללי, היסטוריה, פסיכולוגיה והסקה לוגית. החלק השני מתמקד בקוד ולוגיקה מתקדמת עם 32,166 רשומות, ומכיל מעל 100 מיליון טוקנים שנוגעים בפיתוח מערכות הפעלה, אלגברה מופשטת, חוזים חכמים והנדסה לאחור.

תהליך הייצור התחיל ביצירת פרומפטים מגוונים ומקרי קצה באמצעות מודל ג׳מיני. לאחר מכן נשלחו ההוראות למודל קלוד שייצר את התשובות יחד עם תגיות חשיבה פנימיות שמתעדות את שלבי ההסקה, התיקון העצמי והפתרון הסופי. הנתונים כוללים תערובת של רשומות גולמיות לצד דוגמאות שעברו דירוג וביקורת איכות אוטומטית שנתנה ציון ממוצע של 9.1 מתוך 10.

מתאים ל

  • אימון מודלי קוד מתקדמים

    כוונון מודלים על בעיות תכנות מורכבות בקרנל ומערכות מבוזרות עם הסברים מפורטים.

  • הטמעת שרשראות חשיבה

    לימוד מודלי שפה להשתמש בתגיות חשיבה פנימיות לתיקון עצמי לפני מתן הפתרון.

  • פתרון בעיות מתמטיות

    אימון מודלים להסקה צעד אחר צעד באלגברה מופשטת, מודלים סטוכסטיים וטופולוגיה.

איפה זה נופל

כל המאגר מבוסס על נתונים סינתטיים באנגלית בלבד, ואין בו שום תוכן בעברית או ייצוג לשפות אחרות. המפרסם מציין במפורש שהדאטה לא מסונן כלל וכולל אפס סירובים, גם בנושאים רגישים או שנויים במחלוקת. אם המטרה שלכם היא מודל שירות לקוחות או מוצר שדורש סינוני בטיחות, שימוש בחומר הזה ללא סינון נוסף יכניס תכנים בעייתיים למשקלים. בנוסף, הערכת האיכות נעשתה כולה באמצעות מודל שפה ולא בידי אנשים, כך שציוני האיכות עלולים לשקף הטיות או הזיות של המודל המבקר.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

זה בעייתי מבחינה משפטית. הטקסט הפנימי מציין רישיון MIT, אך הדף הרשמי מוגדר ללא רישיון, ומעל הכל מדובר בפלטים של קלוד וג׳מיני שתנאי השימוש שלהם אוסרים לרוב על אימון מודלים מתחרים. לא הייתי בונה על זה מוצר מסחרי בלי בדיקה משפטית.

האם יש בדאטהסט תמיכה בעברית?

לא. המאגר מוגדר ומיוצר כולו בשפה האנגלית. אם אתם צריכים לאמן מודל להסקה או פתרון קוד בעברית, תצטרכו לתרגם את החומר או לפנות למקורות אחרים.

איך נוצרו הנתונים בפועל?

הפרומפטים נוצרו בצורה אוטומטית על ידי ג׳מיני, והתשובות הופקו מקלוד יחד עם תהליך חשיבה פנימי. חלק מהתשובות עברו שלב נוסף שבו ג׳מיני שימש כשופט חיצוני שנתן ציון וכתב הערות ביקורת על עומק ההסקה.

מה המשמעות של היעדר סינון בדאטהסט?

המודלים הונחו לא לסרב לשום בקשה, כולל נושאים שנויים במחלוקת או תכנים מפורשים. זה טוב למחקר שבוחן חשיבה ללא מגבלות בטיחות, אך מסוכן מאוד למי שרוצה לאמן מודל שיפעל מול משתמשי קצה בלי פיקוח הדוק.

איך טוענים

הנתונים מרוכזים בקובץ jsonl בשם sonnet4.6-general,code,math,psychology.jsonl. אין צורך באישור גישה מיוחד כדי להוריד אותו, אבל חשוב לבדוק את מבנה הרשומות מראש, כי חלקן כוללות ציונים והערות ביקורת וחלקן מכילות רק את רצף החשיבה והתשובה. שדות המפתח החשובים לסינון הם תגיות החשיבה והטקסט המוגמר, במיוחד אם אתם מאמנים על פורמט שיחה מוגדר.

from datasets import load_dataset

ds = load_dataset("Roman1111111/claude-sonnet-4.6-120000x")

הרישיון

יש כאן סתירה ישירה שצריך להיזהר ממנה. בראש הקובץ הטכני מוגדר רישיון MIT, שמתיר שימוש מסחרי חופשי, אבל במטא-דאטה הרשמי של המאגר הרישיון סומן כלא דווח. מעבר לזה, התוכן כולו נוצר באמצעות ממשקי ה־API של קלוד וג׳מיני, מה שמציב סיכון משפטי סביב תנאי השימוש המסחריים של הספקיות על אימון מודלים מתחרים.

הרישיון המלא ב־Hugging Face ↗