GPT
R

reasoning-v1-20m

קוד פתוח

glaiveaiapache-2.02025-02-27

מאגר ענק של שאלות ותשובות סינתטיות עם שרשראות חשיבה בתחומים כלליים. הוא מיועד למי שרוצה לאמן מודלים קטנים לנמק לא רק במתמטיקה או בקוד.

  • 7,043הורדות בחודש
  • 237לייקים

מה זה

המאגר כולל 22.2 מיליון שורות של שאלות ותשובות שמכילות 35.8 מיליארד טוקנים בסך הכל. כל התוכן נוצר באופן סינתטי באמצעות המודל DeepSeek-R1-Distill-Llama-70B כדי לכסות נושאים שאינם קוד או מתמטיקה. תמצאו שם תחומים כמו מדעי החברה, מדעי הטבע, חינוך, כתיבה יוצרת ושיחות כלליות.

מבנה התשובות עוקב אחרי תבנית קבועה שכוללת תגיות חשיבה ייעודיות לפני המענה הסופי. בחלק הראשון מופיע תג think עם שרשרת הנימוק המלאה, ומיד אחריו מגיעה התשובה עצמה. המפרסמים ציינו מפורשות שהם לא ביצעו אימות או סינון של שרשראות החשיבה והתשובות כדי לוודא דיוק עובדתי.

מתאים ל

  • אימון SFT למודלים קטנים

    לימוד מודל מקומי לחשוב ולנמק שלב אחרי שלב בעזרת תגיות החשיבה המוכנות.

  • הסקה בתחומי מדעי החברה

    הרחבת יכולות הנימוק של מודלים לנושאים הומניים ושיחות כלליות מעבר לקוד.

  • מחקר על דאטה סינתטי

    בדיקת ההשפעה של אימון על פלטים של DeepSeek בקנה מידה רחב.

איפה זה נופל

הנתונים נוצרו כולם על ידי מודל שפה וללא שום בדיקת אימות לאמיתות המידע או לאיכות שרשראות ההיגיון. בנוסף, המאגר קיים באנגלית בלבד, כך שהוא לא יעזור למי שמחפש לפתח יכולות ישירות בעברית. לפני שמשתמשים בחומר הזה לאימון מודל שמיועד לייצור, חובה לסנן הזיות, שגיאות עובדתיות וטעויות היגיון שנוצרו בתהליך הסינתטי.

שאלות
נפוצות

האם המאגר כולל עברית?

לא, הנתונים נוצרו וקוטלגו באנגלית בלבד. אם אתם מחפשים לשפר ביצועים בעברית, תצטרכו לתרגם את הדאטה בעצמכם או להסתמך על מאגרים אחרים.

האם מותר להשתמש בו למוצרים מסחריים?

הרישיון המדווח הוא apache-2.0, שמתיר שימוש מסחרי מלא. עם זאת, קחו בחשבון שהתוכן הופק באמצעות מודל חיצוני, לכן כדאי לבדוק גם את תנאי השימוש של מודל המקור.

איך המידע נאסף והאם הוא אמין?

כל 22.2 מיליון הדוגמאות הופקו בצורה סינתטית על ידי DeepSeek-R1-Distill-Llama-70B. המפרסמים מבהירים שהם לא בדקו ולא אימתו את נכונות התשובות או את שרשראות החשיבה.

במה הוא שונה מדאטהסטים אחרים של חשיבה?

רוב מאגרי הנימוק הקיימים מתמקדים בפתרון בעיות מתמטיות או בכתיבת קוד. המאגר הזה מתמקד בעיקר במדעי הרוח, מדעי הטבע, כתיבה יצירתית ושיחות.

איך טוענים

טוענים את הנתונים ישירות דרך הספרייה של Hugging Face בפקודת load_dataset פשוטה לפי שם המאגר והחלק train. המאגר מבוזר על פני 710 קובצי parquet, כך שמומלץ להזרים אותו או לוודא שיש לכם מספיק שטח אחסון וזיכרון עבודה לפני שמורידים את כל החבילה.

from datasets import load_dataset

ds = load_dataset("glaiveai/reasoning-v1-20m")

הרישיון

המאגר פורסם תחת רישיון apache-2.0 שמאפשר שימוש מסחרי, שינוי והפצה של המידע. אתם רשאים לאמן עליו מודלים חופשיים או מסחריים בלי חובה לשתף את המשקלים באותו רישיון, כל עוד אתם שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗