GPT
O

OpenLongCoT-Pretrain

קוד פתוח

di-zhang-fduרישיון לא דווח2024-10-22

המאגר מרכז נתונים לאימון מקדים של מודלים סביב שרשראות חשיבה ארוכות. חוקרים ומפתחים יפנו אליו כדי לשחזר יכולות הנמקה מתמטית מתקדמת בסגנון מודלי הסקת מסקנות חדשים.

  • 93הורדות בחודש
  • 89לייקים

מה זה

המאגר כולל קובץ נתונים יחיד בפורמט פרקט, data/train-00000-of-00001.parquet, לצד קובץ התיעוד הבסיסי. לפי פרטי המאמרים המקושרים, הנתונים מתמקדים בפתרון בעיות מתמטיות ברמת אולימפיאדה באמצעות שרשראות חשיבה מפורטות, כחלק ממחקרים שבדקו שיטות אופטימיזציה בזוגות וחיפוש עץ מונטה קרלו עם שיפור עצמי על גבי מודלים פתוחים.

כרטיס המאגר עצמו דל ביותר ולא מפרט את מבנה הרשומות, כמות הדוגמאות המדויקת, תהליך הסינון או אופן איסוף הטקסטים. כל המידע המהותי על מקורות המידע והמתודולוגיה נשען בלעדית על שני המאמרים האקדמיים שצוטטו, LLaMA-Berry והמחקר על פתרונות אולימפיאדה עם מודל LLaMA-3 8B. אין חלוקה מוגדרת לחלקי בדיקה או ולידציה בתוך המאגר, אלא פיצול אימון יחיד בלבד.

מתאים ל

  • אימון מקדים להסקה

    אימון מודלים על שרשראות חשיבה ארוכות לפתרון בעיות חישוביות מורכבות.

  • שחזור מחקרי מתמטיקה

    שחזור הניסויים שתוארו במאמרי המחקר סביב מתמטיקה אולימפיאדית.

  • מחקר על אופטימיזציה

    בחינת שיטות אימון בזוגות וחיפוש מונטה קרלו על פתרונות מפורטים.

איפה זה נופל

היוצרים לא תיעדו שום מגבלה, הטיות ידועות, שפות נתמכות או את חלוקת הנושאים. מכיוון שהמאמרים עוסקים במתמטיקה אולימפיאדית, סביר שהנתונים ממוקדים בתחום הזה בלבד ולא יועילו להסקה כללית או לטקסט חופשי. אין כל אינדיקציה לקיומו של תוכן בעברית. לפני שמכניסים את זה לפרויקט רציני, חובה לבדוק ידנית את איכות הפתרונות, אמינות הצעדים ורמת הדיוק של שרשראות החשיבה.

שאלות
נפוצות

האם מותר להשתמש בזה לפיתוח מוצר מסחרי?

לא מומלץ בכלל. במאגר לא דווח שום רישיון, מה שאומר שאין לכם היתר שימוש מוגדר בחוק. שימוש מסחרי במצב כזה חושף אתכם לתביעות זכויות יוצרים.

האם הדאטהסט כולל שאלות ופתרונות בעברית?

הכרטיס לא מציין שפות כלל. בהתחשב בכך שהמחקרים עוסקים באולימפיאדות בינלאומיות ופורסמו באנגלית, כמעט בטוח שאין שם עברית.

מאיפה הגיעו הנתונים שבפנים?

הדף לא מסביר איך הדאטה נאסף או נוצר. הרמז היחיד מגיע משני המאמרים שצורפו בציטוט, העוסקים ביצירת פתרונות מתמטיים באמצעות מודלים פתוחים וחיפוש עץ.

איך טוענים

טוענים את הקובץ ישירות דרך ספריית datasets באמצעות המזהה di-zhang-fdu/OpenLongCoT-Pretrain, ללא צורך בבקשת גישה מיוחדת או אישור מוקדם. הנתונים שמורים בקובץ פרקט בודד, אבל שמות השדות המדויקים ומבנה הרשומות אינם מתועדים בכרטיס, כך שתצטרכו לקרוא את השורה הראשונה כדי להבין את הסכמה לפני תחילת העבודה.

from datasets import load_dataset

ds = load_dataset("di-zhang-fdu/OpenLongCoT-Pretrain")

הרישיון

היוצרים לא הגדירו רישיון שימוש במאגר. מבחינה משפטית, היעדר רישיון אומר שכל הזכויות שמורות ואין לכם הרשאה מפורשת להעתיק, להפיץ או לאמן מודלים מסחריים על החומר הזה. אם אתם עובדים בחברה, עדיף לא לגעת בזה עד שהמפרסמים יעדכנו רישיון קוד פתוח מוכר.

הרישיון המלא ב־Hugging Face ↗