GPT
Q

QwQ-LongCoT-130K

קוד פתוח

amphoraapache-2.02024-12-05

מאגר שמביא כ־130 אלף דוגמאות של שרשראות חשיבה ארוכות מאוד שנלקחו ממודל QwQ-32B-Preview. הוא מתאים למי שבונה מודלים שמנסים לחקות יכולות חשיבה מעמיקות בסגנון o1 במתמטיקה ובמדעים.

  • 455הורדות בחודש
  • 153לייקים

מה זה

המאגר כולל כ־130 אלף רשומות שמיועדות לאימון מסוג SFT, כשהרעיון המרכזי הוא תשובות ארוכות שמפרטות תהליכי חשיבה עמוקים. החלוקה הפנימית מורכבת מ־90 אלף שאלות מתמטיות שנלקחו מהמאגר NuminaMath-CoT, ועוד כ־43 אלף שאלות ממגוון תחומים מדעיים כמו פיזיקה, כימיה וביולוגיה שנוצרו בעזרת גישת Magpie מותאמת אישית מול מודל QwQ-32B-Preview.

הסינון כלל כללים פשוטים למדי. היוצר הסיר תשובות שהכילו סירובים כמו התנצלויות או ביטויים שמצהירים על היות המודל מכונה, חתך מקרים של חזרתיות יתר על משפטים, וניסה להוציא תווים בסינית, אם כי חלקם עדיין נשארו שם. המאגר מציג אורך דגימות חריג, כאשר יש בו דוגמאות שמגיעות לעשרות אלפי תווים ואפילו מקרה קצה בודד שחצה 170 אלף תווים.

מתאים ל

  • אימון שרשראות חשיבה

    אימון מודלים מותאם לשאלות מתמטיות ומדעיות שדורשות פירוט שלבי הפתרון.

  • ניסויי RL והסקה

    בדיקת שיטות תגמול ומיסוך טעויות על גבי מסלולי מחשבה ארוכים.

  • ניתוח טעויות במודלים

    חקר האופן שבו מודל מתקן את עצמו תוך כדי יצירת תשובה ארוכה.

איפה זה נופל

הבעיה המרכזית נמצאת באופי הנתונים. היוצר מודה בגלוי שאימון SFT רגיל על הדאטהסט לא עבד טוב, כנראה מפני שמסלולי החשיבה של המודל כוללים טעויות מכוונות ותיקון עצמי, דבר שפוגע במודל אם לא מסננים או ממסכים אותן. מעבר לכך, כל התוכן באנגלית בלבד ללא שום תמיכה בעברית, יש שאריות של תווים בסינית שלא סוננו לחלוטין, ותיעוד הנושאים בחלק של Magpie אבד בחלקו בעת היצירה. לא כדאי להכניס את הדאטה הזה ישירות למוצר בלי ניקוי נוסף.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

כן, הרישיון המדווח הוא apache-2.0 שמתיר שימוש מסחרי מלא. צריך רק לספק ייחוס מתאים ולא לראות ביוצר אחראי לתוצאות. שימו לב שהתשובות יוצרו על ידי QwQ-32B-Preview, אז כדאי לבדוק גם את תנאי המקור של המודל הזה.

האם הדאטהסט מתאים לעבודה בעברית?

לא. המאגר מוגדר ומכיל טקסטים בשפה האנגלית בלבד, יחד עם מעט שאריות של תווים בסינית שלא סוננו. אין בו נתונים בעברית ולכן הוא לא יועיל לאימון שפתי מקומי.

למה אימון ישיר על המאגר עלול להיכשל?

היוצר עצמו דיווח שאימון SFT פשוט הניב מודל ברמה לא מספקת. הסיבה היא שתהליך החשיבה כולל ניחושים שגויים ותיקונים עצמיים, מה שמבלבל את המודל הלומד בלי סינון או מיסוך מתאים של שלבי הטעות.

מאיפה הגיעו השאלות והתשובות?

90 אלף שאלות נלקחו ממאגר המתמטיקה NuminaMath-CoT, ועוד 43 אלף שאלות מדעיות הופקו באמצעות Magpie עם תבנית מותאמת. כל התשובות נוצרו כולן על ידי המודל QwQ-32B-Preview.

איך טוענים

הטעינה נעשית ישירות דרך ספריית datasets של Hugging Face באמצעות מזהה המאגר amphora/QwQ-LongCoT-130K. הגישה חופשית לחלוטין ואין צורך באישורים מיוחדים או בטופס גישה. הנתונים מחולקים לשני קובצי Parquet שמרכיבים יחד את פיצול ה־train, וחשוב לזכור שהטקסטים כוללים שרשראות חשיבה ארוכות במיוחד עם דגימות של אלפי תווים. המשמעות היא שאתם צריכים להגדיר חלון הקשר רחב מאוד בזמן הטעינה והאימון, אחרת חלק ניכר מהחשיבה ייחתך בטוקניזציה. הקבצים כוללים את ההוראות והתשובות שנוצרו.

from datasets import load_dataset

ds = load_dataset("amphora/QwQ-LongCoT-130K")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים ושל מודלים שאומנו עליהם, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי. אין חובה לשתף נגזרות תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗