GPT
C

Complete-FABLE.5-traces-2M

קוד פתוח

Crowneliusרישיון לא דווח2026-06-19

מאגר מסונן של עקבות ריצה ושיחות ממודלי קלוד, שנועד לאימון מודלים על שרשראות חשיבה ושימוש בכלים. הוא מאחד עשרות מקורות שנבדקו ידנית כדי לסנן זיופים ותוכן שבור.

  • 1,575הורדות בחודש
  • 148לייקים

מה זה

המאגר כולל 228,968 שורות מאומתות שנאספו מתוך 28 דאטהסטים שונים ברחבי הגינג פייס. התוכן מחולק לפי משפחות מודלים: 108,413 רשומות מגיעות מסונט ומתמקדות בהסקה ובשאלות ותשובות, 65,350 רשומות מפייבל 5 שמכילות עקבות פעולה של סוכנים ושימוש בכלים, ועוד 55,205 רשומות מאופוס 4.5 עד 4.8 שמציגות חשיבה ברמה גבוהה. שורת מקור נשמרת תחת השדה first_source_dataset.

הסינון כלל בדיקה ידנית שפסלה 40 מאגרים שלמים וכמעט שני מיליון רשומות לא תקינות. הקריטריונים דרשו קריאות טכנית, מבנה מלא של שאלה ותשובה מבוססת, ראיות פנימיות לכך שהפלט אכן הופק במקור על ידי קלוד, ומנגנון מניעת כפילויות כפול שמבוסס על תוכן השדות בפועל ולא רק על גיבוב הקובץ.

מתאים ל

  • אימון סוכני קוד וכלים

    שימוש ב־65,350 עקבות הריצה של פייבל 5 לצורך שיפור יכולות הפעלת כלים ופתרון תקלות תוכנה.

  • זיקוק שרשראות חשיבה

    אימון מודלים קטנים על בסיס 55,205 דוגמאות ההסקה של אופוס לקבלת יכולת פירוק בעיות.

  • מערכי שאלות ותשובות

    הזנת 108,413 רשומות מסונט כדי לבנות בסיס ידע לשיחה ולמענה מנומק באנגלית.

איפה זה נופל

למרות המספר שמופיע בשם המאגר, אין בו שני מיליון רשומות אלא רק 228,968 שורות ששרדו את הסינון. כל המידע הוא באנגלית בלבד ונוצר על ידי מכונה, כך שאין כאן ייצוג לעברית. אם המטרה שלכם היא אימון בעברית, החומר הזה לא מתאים בלי תרגום או התאמה מקיפה. בנוסף, מדובר בנתונים שנוצרו על ידי מודלים מסחריים של אנתרופיק, עובדה שעלולה להגביל שימוש תחרותי לפי תנאי השירות של החברה המקורית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

זה מורכב ומסוכן לעשות זאת ישירות. למרות שהכרטיס הראשי מציין רישיון MIT, חלק ניכר מהנתונים בפנים נאסף ממאגרים ברישיון AGPL 3.0 או ברישיונות לא ברורים. תצטרכו לסנן את השורות לפי שדה המקור ולקחת רק רשומות שהגיעו ברישיונות מתירניים.

האם הדאטהסט כולל תוכן בעברית?

לא. המאגר מוגדר רשמית כחד לשוני באנגלית בלבד. כל עקבות הריצה, השיחות ושרשראות החשיבה שנאספו שם מנוסחות באנגלית.

למה השם כולל 2M אם יש בו פחות רשומות?

השם המקורי נבחר כשהמאסף חיפש נתונים לפי מילות מפתח והגיע לקרוב לשני מיליון רשומות גולמיות. לאחר בדיקות אימות ואיכות התברר שרובן היו זיופים, תבניות ריקות או פלטים של מודלים אחרים, והשם נשמר רק כדי לא לשבור קישורים קיימים.

איך סוננו הנתונים כדי להבטיח שמדובר בקלוד?

המאגר הריץ שער סינון קפדני שבדק מזהים ייחודיים בתוכן עצמו, כמו מזהי כלים של אנתרופיק ושדות מודל מקוריים. מועמדים שכללו שכתובים של מודלים זרים כמו ג׳מה או ג׳מיני נפסלו והוצאו מהאוסף.

איך טוענים

הנתונים מפוצלים לארבעה קובצי פארקט בתיקיית המידע. טוענים אותם באמצעות ספריית datasets בלי צורך באישור גישה מיוחד. מומלץ לשים לב לשדה first_source_dataset כדי לעקוב אחרי המקור, ולסנן לפי שדות הזיהוי של המודל אם אתם צריכים רק עקבות של סוכנים מפייבל 5 או רק שרשראות חשיבה מאופוס ומסונט.

from datasets import load_dataset

ds = load_dataset("Crownelius/Complete-FABLE.5-traces-2M")

הרישיון

המאגר מסומן ברישיון MIT ברמת המטאדאטה, אך בפועל מדובר במראה שמלקטת 28 מקורות שונים עם תנאים סותרים. חלק מהרשומות מגיעות ברישיונות מתירניים כמו MIT ו־Apache 2.0, חלק ברישיונות שיתוף זהה מחמירים כמו AGPL 3.0, ולחלקן אין רישיון ברור במעלה הזרם. אימון מודל מסחרי עלול לחשוף אתכם לדרישות של רישיונות מדבקים, ולכן חובה לסנן את השורות לפי מקורן לפני השימוש.

הרישיון המלא ב־Hugging Face ↗