GPT
C

CUDA-Agent-Ops-6K

קוד פתוח

BytedTsinghua-SIAcc-by-4.02026-02-26

המאגר כולל 6,000 משימות תכנות סינתטיות ברמת אופרטורים ב־PyTorch, שנבנו במיוחד לאימון סוכני למידת חיזוק על אופטימיזציה של קרנלים ב־CUDA. הוא פותר את המחסור בדוגמאות הרצה איכותיות.

  • 829הורדות בחודש
  • 90לייקים

מה זה

הנתונים מורכבים מ־6,000 שורות של קוד פייתון להרצה, שמייצג אופרטורים ומודולים מורכבים. הצוות אסף בעיות בסיס מתוך הספריות torch ו־transformers, ולאחר מכן השתמש במודלי שפה כדי לשלב עד חמישה אופרטורים שונים למשימה מאוחדת אחת, במטרה לדמות עומסי חישוב מורכבים ומגוונים.

כל רשומה עברה סינון קפדני מבוסס הרצה בפועל. המפתחים וידאו שהקוד רץ בהצלחה גם ב־eager mode וגם תחת torch.compile, סיננו החוצה אופרטורים אקראיים כדי לשמור על דטרמיניסטיות, מחקו פלטים מנוונים, והגבילו את זמן הריצה לטווח של 1 עד 100 מילי-שניות. בנוסף, הוסרו משימות הדומות למקרי הבדיקה ב־KernelBench כדי למנוע זליגת מידע למבחני ביצועים.

מתאים ל

  • אימון RL לסוכני קוד

    אימון מודלים מבוססי חיזוק שמטרתם לכתוב ולייעל קרנלים של CUDA לפי קוד פייתון.

  • אופטימיזציית קרנלים

    בניית מודלים שממירים שרשראות אופרטורים ב־PyTorch למימושי CUDA מואצים ועצמאיים.

  • הערכת כלי ייצור קוד

    בדיקת יכולת של מודלים להתמודד עם איחוד אופרטורים מורכבים מ־transformers ללא זליגת נתונים.

איפה זה נופל

כל הנתונים סינתטיים ונוצרו על ידי מודל שפה, כך שייתכנו תבניות קוד מלאכותיות שלא מייצגות עבודה הנדסית אנושית. המאגר מוגבל למשימות באנגלית ובפייתון בלבד ומכיל 6,000 דוגמאות בלבד, כך שזה לא מאגר ענק. המשימות סוננו לרוץ בטווח זמנים ספציפי של עד 100 מילי-שניות, מה שמשאיר בחוץ חישובים כבדים במיוחד.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

כן, הרישיון הוא cc-by-4.0 ומאפשר שימוש מסחרי מלא. הדרישה העיקרית היא מתן ייחוס מתאים למפרסמים במחקר או בתיעוד המוצר. אין מגבלה על שימוש במודל שאומן על הנתונים הללו.

מאיזה מקורות הקוד נאסף ואיך יצרו אותו?

המשימות מתבססות על אופרטורים מתוך torch ומודולים מתוך transformers. מודל שפה שילב בין מספר אופרטורים שונים כדי לייצר קוד מורכב חדש. כל פיסת קוד נבדקה בריצה אמיתית כדי לוודא תקינות.

האם יש במאגר תמיכה בעברית או טקסט חופשי?

לא, המאגר מוגדר כ־en ומכיל קוד פייתון ומזהי אופרטורים בלבד. אין בו שום תוכן בעברית או טקסטים בשפה טבעית מעבר למינוחים הטכניים. הוא מיועד לניתוח ויצירת קוד בלבד.

איך נמנעת זליגת מידע למבחני ביצועים מקובלים?

החוקרים ביצעו סינון דה-קונטמינציה ייעודי בתהליך הבנייה. הם הסירו מהמאגר משימות בעלות דמיון גבוה למקרי המבחן של KernelBench. הפעולה הזו נועדה לאפשר הערכה אמינה של מודלים שאומנו עליו.

איך טוענים

טוענים את המאגר ישירות מקובץ data.parquet שיושב במאגר, ללא צורך בבקשת גישה מיוחדת או אישור מוקדם. המבנה פשוט מאוד ומכיל שלוש עמודות מחרוזת ללא ערכים חסרים: ops שמתארת את רשימת האופרטורים, data_source שמציינת את מקור המשימה, ו־code שמכיל את קוד ה־PyTorch להרצה.

from datasets import load_dataset

ds = load_dataset("BytedTsinghua-SIA/CUDA-Agent-Ops-6K")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. המשמעות היא שניתן להשתמש בו לצרכים מחקריים ומסחריים, וכן לאמן עליו מודלים, כל עוד מקפידים לתת קרדיט נאות ליוצרים. הרישיון אינו כופה שיתוף של תוצרי הפיתוח או המודלים המאומנים תחת אותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗