GPT
K

KIMI-K2.5-1000000x

קוד פתוח

ianncityapache-2.02026-03-25

  • reasoning
  • chain-of-thought
  • instruction-tuning
  • sft

מיליון שרשראות חשיבה שחולצו מהמודל Kimi K2.5 במצב חשיבה גבוה. זה מאגר סינתטי שמיועד למי שרוצה לאמן מודלים על פתרון בעיות קוד ומדעים ברמה מתקדמת.

  • 2,176הורדות בחודש
  • 265לייקים

מה זה

המאגר כולל מיליון רשומות המכילות עקבות חשיבה שנאספו לאורך כשמונים שעות באמצעות גרסה מותאמת של כלי יצירת הדאטה של TeichAI. מדובר בטקסטים שנוצרו במצב חשיבה גבוה של המודל, ונפח הטוקנים הכולל עומד על כחמישה מיליארד.

התוכן מחולק לקבצים שונים לפי נושאים. מחצית מהדאטה מוקדשת לתכנות בשפות כמו פייתון, רובי, סי שארפ, ראסט, לואה, ווב ועוד. עשרים אחוז עוסקים במדעים כמו פיזיקה, כימיה וביולוגיה, כולל קובץ ייעודי למדעים ברמת תואר שלישי שמכיל מאה אלף תשובות נוספות. מתמטיקה מהווה חמישה עשר אחוזים, עם קובץ נפרד של מאתיים אלף תשובות באלגברה, חדווא והסתברות. שאר הדאטה מתפזר על מדעי המחשב, שאלות הגיון, כתיבה יוצרת, וקובץ של מאה אלף דוגמאות בתחומי המדעים וההנדסה במספר שפות.

מתאים ל

  • אימון מודלי קוד והסקה

    כחצי מהמאגר מוקדש לשפות פיתוח שונות, מה שמתאים לחיזוק יכולות תכנות ומעקב אחר פתרונות.

  • זיקוק שרשראות חשיבה

    הדאטה כולל חמישה מיליארד טוקנים של פתרון בעיות צעד אחר צעד לטובת אימון מודלים קטנים יותר.

  • פתרון בעיות מתמטיקה ומדע

    קבצים ייעודיים של מאות אלפי דוגמאות מתקדמות מאפשרים כוונון עדין על שאלות אקדמיות מורכבות.

איפה זה נופל

זהו דאטהסט סינתטי לגמרי שחולץ ממודל יחיד, כך שכל הטיה או הזיה של Kimi K2.5 נכנסת ישר פנימה. למרות קיומו של קובץ מדעים רב לשוני, הדאטהסט מוגדר באנגלית ואין בו שום התייחסות לעברית. היוצר ציין כי תהליך האיסוף לקח כשמונים שעות בלבד וכי הוא מפסיק לעדכן את המאגר, כך שאין כאן בדיקות איכות ידניות או תיקוני טעויות מתמשכים. לפני שדוחפים את זה לאימון מודל פרודקשן, חובה לדגום ולבדוק את נכונות הקוד ושלבי הפתרון המתמטיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן. הדאטהסט מוגדר תחת רישיון apache-2.0 שמתיר שימוש מסחרי, שינוי והפצה. היוצר אף ציין במפורש שניתן להשתמש בו לכל מטרה ללא צורך בקרדיט, כל עוד לא טוענים לבעלות עליו.

כמה מקום המאגר תופס בדיסק?

המאגר שוקל כעשרים ג'יגה בייט. הוא כולל חמישה מיליארד טוקנים שמחולקים לשישה קבצים, רובם בפורמט jsonl.

האם המאגר כולל תוכן בעברית?

השפה המדווחת במאגר היא אנגלית בלבד. ישנו קובץ יחיד של מאה אלף דוגמאות מדעיות שמוגדר כרב לשוני, אך אין תיעוד על קיומה של עברית בתוכו.

איך הנתונים נאספו והאם הם אמינים?

הנתונים הם סינתטיים לחלוטין ונאספו באמצעות כלי ייצור מותאם במשך כשמונים שעות ישירות מפלט המודל Kimi K2.5. מכיוון שלא נעשה סינון ידני מתועד, ייתכנו טעויות והזיות בשרשראות החשיבה ומומלץ לבצע בדיקות איכות עצמאיות.

איך טוענים

הנתונים מגיעים בקובצי jsonl פתוחים להורדה ישירה ללא צורך באישור גישה. גודל המאגר הוא כעשרים ג'יגה בייט. הטעינה נעשית בקריאה ישירה של קובצי הטקסט הללו, למשל kimi-k2.5-main.jsonl או הקבצים הייעודיים לתחומי המתמטיקה והמדעים, ומכיוון שמדובר בתוצרי חשיבה, השדות כוללים את תהליכי הפתרון המלאים והתשובות שנוצרו.

from datasets import load_dataset

ds = load_dataset("ianncity/KIMI-K2.5-1000000x")

הרישיון

המאגר מפורסם ברישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי והפצה, ומותר לאמן עליו מודלים ללא הגבלה מסחרית. היוצר ציין שאין צורך לתת לו קרדיט, אך הדגיש שהוא מעדיף שמשתמשים לא יטענו שהדאטה שייך להם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗