GPT
G

gemini-3-pro-10000x-hard-high-reasoning

קוד פתוח

Roman1111111mit2026-02-19

  • code
  • finance
  • legal
  • agent
  • chemistry

מאגר נתונים סינתטי של שאלות מורכבות ופתרונות עמוקים שנוצרו במודלים של גוגל. הוא מיועד למי שמנסה לחזק יכולות הסקה לוגית ופתרון בעיות במודלים קטנים יותר.

  • 61הורדות בחודש
  • 57לייקים

מה זה

הנתונים נוצרו בתהליך שבו ג׳מיני 3 פלאש ו־GPT 5.2 יצרו פרומפטים קשים ומפורטים, וג׳מיני 3 פרו ייצר את שרשראות הפתרון המלאות. המאגר כולל בין עשרת אלפים למאה אלף רשומות בהיקף של כ־17.8 מיליון טוקנים, ללא תוכן משיחות אמיתיות או איסוף ידני של מומחים אנושיים.

כל שורה מייצגת בעיה ספציפית ומכילה חמישה שדות: תחום ידע, רמת קושי, תת-נושא, הפרומפט המורכב והתשובה המלאה. התחומים מתמקדים במתמטיקה מתקדמת כמו תחרויות פוטנאם, תכנות מערכות בקרנל של לינוקס וראסט, פיזיקה, רפואה, ומשפטים, כשהדגש הוא על בעיות שלא נפתרות בשליפת מידע פשוטה.

מתאים ל

  • אימון מודלי קוד והסקה

    כוונון עדין למודלים בגודל 2 עד 30 מיליארד פרמטרים שמתקשים בשלבי הסקה לוגית וקוד מערכות.

  • הערכת ביצועי מודלים

    בדיקת יכולות של מודלים מול שאלות מתמטיקה, פיזיקה ופתרון בעיות ברמת קושי גבוהה.

  • מבחני עמידות למערכות אחזור

    בדיקת מערכות RAG מול שאלות מורכבות שלא ניתנות לפתרון פשוט באמצעות שליפת טקסט ישירה.

איפה זה נופל

התוכן כולו באנגלית בלבד, ואין פה ייצוג לעברית. בנוסף, מדובר במידע סינתטי שנוצר במלואו על ידי מודלי שפה, ולכן ייתכנו הזיות עובדתיות או שגיאות עדינות בהוכחות לוגיות שלא עברו בדיקה אנושית. המפרסם מציין שהמאגר כולל מעקפי בטיחות מכוונים לצורכי למידה, כולל דוגמאות של אבטחת מידע, ניתוח חולשות וקוד שדורש סביבה מבודדת, כך שלא הייתי דוחף אותו ישירות למודל שירות לקוחות בלי סינון מחמיר.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

המאגר מוגדר תחת רישיון MIT שמתיר שימוש מסחרי ופיתוח מודלים נגזרים. היוצר ציין בקשה לעבוד מולו אם מתכננים להשתמש בו, אבל מבחינת תנאי הרישיון הפורמליים הגישה פתוחה.

האם יש במאגר שאלות בעברית?

לא. כל הנתונים נכתבו באנגלית אקדמית וטכנית בלבד. אם המטרה היא אימון ייעודי לעברית, המאגר לא יעזור ללא תרגום.

איך הנתונים נאספו ונבדקו?

כל המאגר יוצר באופן סינתטי באמצעות סוכן מבוסס ג׳מיני 3 פלאש ו־GPT 5.2 שניסח שאלות, וג׳מיני 3 פרו שסיפק את הפתרונות. לא היה כאן איסוף של בני אדם או בדיקת מומחים ידנית על כל תשובה.

מה מבדיל את המאגר הזה ממאגרי הוראות רגילים?

הוא מתמקד כמעט אך ורק ברמות קושי חריגות בתחומי מדעים מדויקים, קוד ואבטחה, ולא בשיחות יומיומיות. השאלות נבנו בכוונה כך שלא ייפתרו בחיפוש פשוט אלא יחייבו גזירה של שלבים לוגיים מורכבים.

איך טוענים

המידע מגיע בקובץ טקסט בפורמט jsonl בשם gemini-3-pro.jsonl, לצד קובץ תיעוד. אין צורך לבקש אישור גישה מיוחד מראש או להמתין להרשאות, אפשר למשוך ישירות מהמאגר הציבורי. מומלץ לעבוד ישירות מול השדות prompt ו־response לצורכי אימון, ולהשתמש בשדות domain ו־difficulty אם רוצים לסנן רק רמות קושי ספציפיות כמו דוקטורט או תחומי ידע מסוימים.

from datasets import load_dataset

ds = load_dataset("Roman1111111/gemini-3-pro-10000x-hard-high-reasoning")

הרישיון

הרישיון המוגדר הוא MIT, מה שמתיר שימוש מסחרי, שינוי והפצה חופשית, כולל אימון מודלים מסחריים, בכפוף לשמירת תנאי הרישיון המקוריים. עם זאת, היוצר הוסיף בטקסט בקשה אישית ליצור איתו קשר לשיתוף פעולה לפני שמשתמשים, אם כי משפטית רישיון MIT עצמו לא מתנה זאת.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗