GPT
K

kernelbot-data

קוד פתוח

GPUMODEother2025-06-19

  • code

פתרונות קוד שנכתבו לתחרויות אופטימיזציה של קרנלים לכרטיסי מסך. מי שמחפש קוד ביצועים אמיתי לחומרה ספציפית ימצא כאן ניסיונות שעבדו וכאלה שנכשלו במקום עוד דוגמאות בסיסיות מתיעוד רשמי.

  • 1,369הורדות בחודש
  • 49לייקים

מה זה

הנתונים מגיעים מפלטפורמת התחרויות KernelBot וכוללים הגשות של קרנלים מותאמים לחומרה מסוימת. הרשומות מחולקות לקובצי Parquet שונים לפי מסלולי התחרות והארכיטקטורות, ורובן כוללות את קוד המקור המלא לצד תוצאות הריצה. יש כאן חלוקה ברורה בין קבצים שמכילים את כלל ההגשות לבין קבצים שעברו ניקוי כפילויות לפי משתמש וקוד, או קבצים שכוללים רק הגשות שעברו בדיקות תקינות.

המבנה מפוצל לפי יעדים הנדסיים. יש קבצים להגשות AMD MI300 על בעיות כמו fp8-gemm ופעולות תקשורת, קובץ נפרד לתחרות AMD 1.1M ששוקל סביב 699 מגה, קובץ סביב 1.4 ג'יגה להגשות NVIDIA Blackwell NVFP4, וקובץ גדול של 4.3 ג'יגה לבעיות אלגברה לינארית כמו cholesky ופירוק QR. בנוסף מופיעים קבצים קטנים יותר עבור בעיות PMPP v2, אתגר trimul שמתמקד במיקס חומרות, והגשות Helion B200 Nebius.

מתאים ל

  • אימון מודלים לכתיבת CUDA

    לימוד מודל קוד לייצר אופטימיזציות מורכבות לכרטיסי מסך חדשים של NVIDIA ושל AMD.

  • ניתוח טכניקות האצה בחומרה

    חקר גישות של מפתחים לפתרון צווארי בקבוק בחישובי FP8 ופעולות תקשורת מקביליות.

  • בנצ'מרק לביצועי קרנלים

    השוואת ביצועים מול קודי מקור מדורגים שנמדדו ישירות על כרטיסי MI300 וארכיטקטורת Blackwell.

איפה זה נופל

חלק מנתוני המדידה בעייתיים והמפרסמים מציינים זאת ישירות. התוצאות עבור Helion B200 Nebius מוגדרות כשבירות ויש להתייחס לציונים שם בזהירות רבה. בבעיית dual_gemm של NVIDIA, המדידות המקומיות איבדו אמינות באמצע התחרות, ורק הלוח שנמדד על גבי תשתית Modal נחשב אמין. בנוסף, לוח תוצאות ישן של qr במספר 773 אינו נכלל בקובץ האלגברה הלינארית. הנתונים מוגבלים לחומרות הספציפיות שנבדקו ואינם מכילים שפה טבעית מעבר להערות בקוד.

שאלות
נפוצות

האם מותר לאמן על הדאטהסט מודל מסחרי?

הרישיון מתיר אימון מודלים מסחריים רק תחת תנאי הדדיות מחקרית. מי שמאמן מודל או שירות בינה מלאכותית על המאגר מחויב לאפשר לקהילת GPU Mode ולחוקרים גישת יצירה והערכה במערכת בתנאים זהים למשתמשים רגילים. אם המוצר שלכם סגור לחלוטין ולא מאפשר גישה כזו, הרישיון אוסר את השימוש לאימון.

כמה שוקלים הקבצים ואיך הם מאורגנים?

הנפח הכולל מגיע למספר ג'יגה בייטים, כאשר הקבצים הגדולים ביותר הם קובץ האלגברה הלינארית ששוקל כ־4.3 ג'יגה וקובץ NVFP4 ששוקל כ־1.4 ג'יגה. קיימים קבצים קטנים בהרבה של עשרות בודדות של מגה בייטים עבור בעיות ספציפיות כמו PMPP ו־Helion. הכל נשמר כקובצי Parquet נפרדים לפי סוגי החומרה והאתגרים.

האם יש בדאטהסט טקסט בעברית?

אין במאגר טקסט בעברית. כל הנתונים מורכבים מקוד מקור טכני לכתיבת קרנלים ומספרים של זמני ריצה שנאספו מפלטפורמת התחרויות.

מה הופך את הנתונים לשונים ממאגרי קוד רגילים בגיטהאב?

בניגוד לקוד כללי ממאגרים ציבוריים, כאן כל שורת קוד מיועדת לחומרה מוגדרת ונבדקה במדידות זמן ריצה ממשיות. יש הפרדה מובנית בין פתרונות שעברו בהצלחה בדיקות תקינות לבין פתרונות שנכשלו, מה שמאפשר להשוות ישירות בין קוד תקין לקוד שגוי ובין רמות ביצועים שונות לאותה המשימה בדיוק.

איך טוענים

הקבצים שמורים בפורמט Parquet ונגישים להורדה ישירה דרך המאגר, ללא צורך בהרשאות גישה מיוחדות. יש פה עשרים קבצים בסך הכל, וחלקם כבדים מאוד, כך ששווה להוריד רק את הקובץ שרלוונטי למשימה שלכם במקום למשוך את כל המאגר. המפרסמים צירפו סקריפט פייתון בשם analyze_submissions שמספק פונקציות טעינה מוכנות לניתוח המובילים בלוח התוצאות והתקדמות המשתתפים. השדות המרכזיים שתרצו לבדוק הם טקסט הקוד, מזהה המשתמש, מזהה הבעיה וזמן הריצה בשניות, שבו מספר נמוך מעיד על ביצועים טובים יותר.

from datasets import load_dataset

ds = load_dataset("GPUMODE/kernelbot-data")

הרישיון

המאגר כפוף לרישיון מיוחד בשם June 9 Researcher Reciprocity License. מותר לנתח, לשתף ולעשות שימוש מחקרי או מסחרי כל עוד נותנים ייחוס הולם ליוצרים. עם זאת, אימון, זיקוק או שיפור של מודלי שירותי בינה מלאכותית מחייבים הדדיות. אם אתם מאמנים עליו מודל, אסור לכם להגביל את חברי GPU Mode וחוקרים מורשים מלהריץ אצלו שאילתות, לבצע בדיקות ביצועים ולחקור באותם תנאים שניתנים למשתמשים רגילים.

הרישיון המלא ב־Hugging Face ↗