GPT
Q

QWQ-LONGCOT-500K

קוד פתוח

Tiinyapache-2.02024-12-10

חצי מיליון תשובות ארוכות במיוחד שנוצרו במודל QwQ-32B-Preview לאימון יכולות חשיבה. רובן עוברות שמונת אלפים טוקנים ומתאימות למי שבונה מודל להסברים מורכבים.

  • 124הורדות בחודש
  • 124לייקים

מה זה

המאגר כולל סביב חצי מיליון רשומות שמציגות שרשראות חשיבה מפורטות. כדי לבנות את השאלות, השתמשו בשיטות מבוססות פרסונות במטרה ליצור הוראות מאתגרות ולא טריוויאליות, ושילבו פרומפטים ממספר מקורות שונים לפי התיעוד. מעבר לכך, היוצרים לא מפרטים באילו מקורות זרע מדוייקים השתמשו או איך בוצע הסינון.

יותר מ־75 אחוז מהתשובות שנוצרו בדאטהסט ארוכות מאוד ועוברות שמונת אלפים טוקנים כל אחת. המבנה מיועד בעיקר למי שרוצה לאמן מודלים על תהליכי הסקת מסקנות מתמשכים, ולא על מענה קצר או עובדתי מהיר. אין כאן חלוקה רשמית לחלקי משנה, אלא קובץ מרכזי שמרכז את כלל הנתונים הסינתטיים.

מתאים ל

  • אימון שרשראות חשיבה

    לימוד מודלים איך לייצר הנמקות ארוכות ומעמיקות במיוחד של אלפי טוקנים.

  • מחקר על דאטה סינתטי

    בדיקת ההשפעה של טקסט סינתטי ממודלים מתקדמים על איכות המענה של מודלים קטנים.

  • בניית מודלי שיחה מורכבים

    שיפור יכולת התמודדות עם הוראות קשות ומבוססות פרסונה באנגלית.

איפה זה נופל

הנתונים כולם סינתטיים ומגיעים מהמודל QwQ-32B-Preview, כך שהם כוללים הזיות, טעויות והטיות שעברו מהמודל עצמו וממקורות הזרע שמהם הוא למד. הכרטיס מודה במפורש שהתוכן כללי ולא מייצג תחום ספציפי, מה שעלול להקשות על ביצועים במשימות מקצועיות בעולם האמיתי. חוץ מזה, המאגר באנגלית בלבד. אם המוצר שלכם צריך עברית או עובדות מבוססות היטב ללא תקלות לוגיות, תצטרכו להריץ עליו סינון איכות קפדני מאוד לפני שמישהו יראה אותו.

שאלות
נפוצות

האם המאגר מתאים לפיתוח מודלים בעברית?

לא. המאגר מוגדר ומכיל טקסט באנגלית בלבד. אם אתם צריכים לאמן יכולות בעברית, הנתונים כאן לא יעזרו לכם ללא תרגום או שילוב מקורות מקומיים.

האם מותר להשתמש בו למוצר מסחרי?

כן, הרישיון המדווח הוא Apache 2.0 שמתיר שימוש מסחרי. עליכם רק לציין ייחוס מתאים ליוצרים ולשמור על תנאי הרישיון, אך תוכלו להשתמש במודל שתאמנו במוצר פעיל.

מאיפה הגיעו הפרומפטים שבדאטהסט?

היוצרים שילבו שאלות ממספר מקורות איכותיים ויצרו אותן בשיטות מבוססות פרסונה. עם זאת, הם לא ציינו במפורש שמות של מאגרי מקור או כתובות ספציפיות בכרטיס.

האם המאגר שוקל הרבה בזמן אימון?

כן, בעיקר מבחינת טוקנים. יותר מ־75 אחוז מהתשובות חוצות את רף שמונת אלפים הטוקנים, כך שאימון עליו דורש משאבי חישוב וחלונות הקשר גדולים משמעותית מדאטהסט רגיל.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות המזהה Tiiny/QWQ-LONGCOT-500K, או שמורידים ידנית את הקובץ qwq_500k.jsonl מהמאגר. הגישה פתוחה לחלוטין ואין צורך לבקש הרשאה מיוחדת כדי להתחיל לעבוד.

קחו בחשבון שמדובר בקובץ jsonl שמחזיק חצי מיליון דוגמאות עמוקות מאוד, כשרובן מעל שמונת אלפים טוקנים. המשקל בעת טעינה לזיכרון וזמני האימון יהיו כבדים משמעותית מדאטהסט טקסט רגיל, אז תצטרכו להכין מראש חומרת אחסון ועיבוד מתאימה.

from datasets import load_dataset

ds = load_dataset("Tiiny/QWQ-LONGCOT-500K")

הרישיון

הרישיון המדווח הוא Apache 2.0, מה שמאפשר שימוש חופשי, כולל שימוש מסחרי ושינוי של הנתונים. אתם יכולים לאמן עליו מודלים פנימיים או מסחריים בלי חובת שיתוף של התוצרים באותו רישיון. החובה העיקרית היא מתן ייחוס למחברים ושמירה על הודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗