GPT
E

Edge-Agent-Reasoning-WebSearch-260K

קוד פתוח

yatin-superintelligencemit2026-03-09

  • text
  • 3d
  • image
  • synthetic
  • agentic

מאגר סינתטי עצום שנועד לאמן מודלים קטנים לעצור, לנתח פערי ידע ולייצר שאילתות חיפוש לפני ביצוע. במקום לענות ישר, המודל לומד לתכנן ולאמת עובדות עבור מודל קצה חזק יותר.

  • 6,006הורדות בחודש
  • 52לייקים

מה זה

כל רשומה במאגר מייצגת תרחיש עבודה שבו מודל קטן מתבקש לטפל בבעיה מקצועית מורכבת. במקום תשובה ישירה למשתמש, הפלט כולל תהליך חשיבה מובנה וארוך של 2,000 עד 5,000 מילים המחולק לחמישה שלבים קבועים: הבנת הבקשה, הפרדה בין ידע מוצק לאי ודאות, איתור עמימויות, בניית רשימת אימות עובדתית וניסוח שאילתות חיפוש מדויקות לפתרון הבעיה.

התוכן כולו סינתטי ומבוסס על מטריצה של שבעה ממדים ששילבה תעשיות, תפקידים, מערכות הפעלה ורמות סיכון. מתוך כמיליארד שילובים אפשריים נדגמו כ־260 אלף שורות, כשהמטרה המוצהרת היא למנוע כפילויות ולייצר מגוון רחב של תרחישי קצה טכניים.

הנתונים מחולקים ל־271 קבצי parquet שונים ללא חלוקה מוגדרת מראש לסט אימון ומבחן. המבנה כולל שדות של תפקיד, תעשייה, מערכת הפעלה, הפרומפט המקורי של המשתמש, ובלוק החשיבה המלא של הסוכן.

מתאים ל

  • אימון נתבי RAG

    לימוד מודלים קטנים לפרק שאלות מורכבות ולייצר שאילתות חיפוש טכניות וממוקדות עבור מערכות שליפה.

  • סינון ויירוט פרומפטים

    בניית מסווג שמזהה הוראות עמומות ומבקש הבהרות מהמשתמש לפני שפונים ל־API יקר של מודל גדול.

  • כוונון חשיבה למודלי קצה

    אימון מודלי 7B עד 14B לעצור ולבצע הערכה עצמית של פערי ידע לפני מתן תשובה שעלולה לכלול הזיות.

איפה זה נופל

המאגר כולו סינתטי ונוצר באמצעות מודלי שפה, כך שייתכנו הטיות מובנות והזיות שהשתרבבו לתהליכי החשיבה למרות המבנה המוקפד. אין כאן נתונים בעברית כלל, כל הטקסטים באנגלית טכנית בלבד. בנוסף, המודל מתמקד רק בשלב התכנון והחיפוש, הוא אינו מכיל את תוצאות החיפוש עצמן בפועל או את התשובה הסופית שנמסרת למשתמש, מה שהופך אותו ללא רלוונטי לאימון מודלים לביצוע משימות קצה מקצה לקצה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון MIT מאפשר שימוש מסחרי מלא, כולל אימון מודלים פנימיים או מוצרים שנמכרים ללקוחות. התנאי היחיד הוא שמירת הצהרת זכויות היוצרים והרישיון המקורי בתיעוד הפרויקט.

האם המאגר כולל תוכן בעברית?

לא. כל הנתונים, הפרומפטים ותהליכי החשיבה נכתבו באנגלית בלבד. אם המוצר שלכם מיועד לעבודה בעברית, תצטרכו לתרגם את הנתונים או לבצע התאמה ייעודית.

איך המידע נאסף והאם מדובר בשיחות אמיתיות?

המידע אינו מבוסס על משתמשים אמיתיים אלא נוצר כולו בצורה סינתטית באמצעות מודלי שפה. המחבר בנה מטריצה של תפקידים, מערכות הפעלה ומשימות, ודגם ממנה שילובים שעל בסיסם נוצרו תרחישי החשיבה.

האם הדאטהסט כולל את תוצאות החיפוש ואת התשובה הסופית למשתמש?

לא, המאגר מסתיים בשלב ניסוח שאילתות החיפוש ותוכנית האימות. אין בו את תוכן דפי האינטרנט שנמצאו ולא את הפלט הסופי שמקבל משתמש הקצה, כי מטרתו לאמן סוכן מכין ולא סוכן מבצע.

איך טוענים

טוענים את הקבצים ישירות דרך ספריית datasets או כקובצי parquet רגילים באמצעות pandas ו־polars. אין צורך בבקשת גישה או באישור מיוחד מיוצר המאגר, הגישה פתוחה לחלוטין. קחו בחשבון שמדובר בנפח טוקנים משמעותי מאוד, כמעט 700 מיליון טוקנים בכלל העמודות, כך שאימון מלא דורש משאבי מחשוב כבדים וזיכרון נרחב לעיבוד טקסטים באורך של אלפי מילים לכל רשומה. השדות העיקריים שתצטרכו לחלץ לצורך כוונון הם user_prompt כקלט ו־agent_reasoning כפלט הרצוי.

from datasets import load_dataset

ds = load_dataset("yatin-superintelligence/Edge-Agent-Reasoning-WebSearch-260K")

הרישיון

המאגר מופץ תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים, מחקריים ואישיים, כולל אימון מודלים מסחריים והפצתם, ללא חובת שיתוף של תוצרי האימון באותו הרישיון. הדרישה היחידה היא שמירת הודעת זכויות היוצרים ונוסח הרישיון המקורי בקבצי הפרויקט שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗