GPT
A

AceMath-Instruct-Training-Data

קוד פתוח

nvidiacc-by-nc-4.02025-01-15

  • nvidia
  • code
  • math
  • general_domain
  • AceMath

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

ערכת נתונים עצומה לכוונון מודלים בהסקה מתמטית וכתיבת קוד. אנבידיה שחררה כאן מיליוני דוגמאות שנוצרו באמצעות מודלים חזקים כדי להביא מודלי בסיס לביצועי שיא.

  • 443הורדות בחודש
  • 65לייקים

מה זה

המאגר מחולק לשלושה קבצי Parquet שמייצגים שלבי אימון שונים של מודלי AceMath. השלב הראשון מכיל 2,261,687 דוגמאות של קוד ומתמטיקה. השלב השני כולל 1,634,573 דוגמאות שמשלבות קוד, מתמטיקה ותחומים כלליים. החלק השלישי מיועד כולו לחשיבה מתמטית ממוקדת עם 1,661,094 דוגמאות נוספות.

המבנה של הרשומות פשוט ועקבי. כל שורה מכילה שדה של הודעות עם תפקיד המשתמש והתוכן של השאלה, לצד שדה נפרד לתשובה הסופית. לפי התיעוד, אנבידיה השתמשו ברצף הזה כדי לכוונן מודלים מסדרת Qwen2.5-Math-Base, כאשר גם אימון על הקובץ המתמטי בלבד הניב תוצאות תחרותיות מאוד בניסויים שלהם.

מקור התוכן הוא סינתטי ברובו ונשען על מודלים קיימים. התשובות לפרומפטים המתמטיים נוצרו באמצעות Qwen2.5-Math-72B-Instruct. עבור שאר סוגי ההנחיות בקוד ובתחום הכללי, התשובות הופקו באמצעות המודל GPT-4o-mini של חברת OpenAI.

מתאים ל

  • אימון מודלים במתמטיקה

    כוונון מודלי שפה פתוחים להסקה מתמטית מתקדמת באמצעות קובץ ה־SFT הייעודי.

  • אימון משולב לקוד ושיחה

    שיפור יכולות תכנות והוראות כלליות בעזרת שני שלבי הנתונים הראשונים.

  • מחקר על דאטה סינתטי

    בדיקת השפעת זיקוק מפלט של מודלים חזקים על ביצועי מודלים קטנים יותר.

איפה זה נופל

הנתונים כולם באנגלית ואין כאן תמיכה בעברית. כל התשובות סונטזו על ידי מודלים מסחריים ופתוחים, כך שהן עלולות לכלול שגיאות לוגיות סמויות שהזיות מודל מייצרות. מעבר לזה, הכרטיס אינו מפרט תהליך סינון ידני או בדיקות אימות חיצוניות על הפתרונות שנוצרו.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא, השימוש מוגבל למטרות מחקר בלבד תחת רישיון CC-BY-NC-4.0. בנוסף, הנתונים הופקו בחלקם באמצעות GPT-4o-mini של OpenAI, דבר הכפוף לתנאי השימוש שלהם שאוסרים שימוש מסחרי מתחרה. כל מודל שתאמנו על המאגר לא יוכל להימכר או להניב הכנסות ישירות.

האם הדאטהסט כולל שאלות ופתרונות בעברית?

המאגר מוגדר כולו באנגלית ואינו מכיל עברית. כל הפרומפטים והפתרונות נוסחו באנגלית על ידי מודלי השפה שיצרו אותם. כדי להשתמש בו לקהל מקומי תידרשו לתרגם את הנתונים או לאמן בשילוב נתונים בעברית ממקור אחר.

מאיפה הגיעו הנתונים שנמצאים בקבצים?

הנתונים הם פלט סינתטי שנוצר במיוחד עבור פרויקט AceMath. התשובות לפרומפטים המתמטיים הופקו מהמודל Qwen2.5-Math-72B-Instruct. שאר התשובות עבור קוד ותחומים כלליים סונטזו על ידי GPT-4o-mini.

האם חובה לאמן על כל שלושת הקבצים יחד?

ממש לא. לפי הבדיקות של אנבידיה בכרטיס המאגר, כוונון מודלי בסיס רק על קובץ המתמטיקה הניב ביצועי הסקה תחרותיים מאוד. אפשר להשתמש רק בקובץ המתמטי או לשלב את שלבי ה־general בהתאם למטרות שלכם.

איך טוענים

טוענים את המאגר ישירות בספריית datasets של Hugging Face בעזרת load_dataset, ללא צורך באישור גישה מוקדם. מגדירים במילון את הנתיבים לשלושת קבצי ה־parquet שבתיקיית data. כל דוגמה מגיעה במבנה מילוני שמכיל את המערך messages עם תוכן השאלה של המשתמש, ואת השדה answer שמכיל את הפתרון. כדאי להגדיר תיקיית מטמון מקומית כי מדובר במיליוני רשומות.

from datasets import load_dataset

ds = load_dataset("nvidia/AceMath-Instruct-Training-Data")

הרישיון

הרישיון הוא CC-BY-NC-4.0 שמיועד לשימוש לא מסחרי בלבד ומחייב מתן קרדיט לאנבידיה. המגבלה הזו נובעת גם מתנאי השימוש של OpenAI, מאחר שחלק מהמידע הופק על ידי GPT-4o-mini. אסור להשתמש בנתונים האלה כדי לאמן מודלים למוצר מסחרי או לייצר מהם רווח.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗