GPT
K

KernelBook

קוד פתוח

GPUMODEother2025-03-14

זוגות מקבילים של מודולי פייתורץ' וקוד טריטון שנוצר אוטומטית מקומפילציה שלהם. המאגר מיועד לאימון מודלים שממירים חישובי למידה עמוקה לקרנלים מואצים בלי כתיבה ידנית.

  • 280הורדות בחודש
  • 57לייקים

מה זה

המאגר מכיל זוגות של קוד פייתורץ' וקוד טריטון מקביל שנוצר באמצעות torch inductor. הצוות אסף מאגרי קוד מגיטהאב על בסיס The Stack v1, חילץ מתוכם מודולים בודדים של torch.nn ובודד את התלויות הנדרשות עבורם. כדי לוודא תקינות, הם יצרו בדיקות יחידה לכל מודול ומחקו מהמאגר כל קטע קוד שלא הצליחו לייצר עבורו בדיקה עובדת.

לאחר מכן הריצו torch.compile על הקוד כדי להפיק קרנלים של טריטון, והמירו את הפלט לפורמט שמזכיר את KernelBench. כל רשומה כוללת מטא דאטה של המקור: שם המאגר, קישור ישיר לקומיט הספציפי שנבדק, רשימת הרישיונות המקוריים וכמות הכוכבים בגיטהאב. הקוד נוצר תחת PyTorch 2.5.0, כך שכל הרצה או בדיקה תלויה ישירות בסביבה הזו.

מתאים ל

  • אימון מודל תרגום קוד

    אימון רשתות שפה להמרת מודולי torch.nn לקרנלים יעילים של טריטון בלי תלות בהידור בזמן אמת.

  • בנצ'מרק למהדרי קוד

    השוואת ביצועים ודיוק של קרנלים שנוצרו אוטומטית מול קוד פייתורץ' מקורי עם בדיקות יחידה קיימות.

  • מחקר על אופטימיזציית GPU

    ניתוח דפוסי הקוד שנוצרים על ידי torch inductor והבנת צווארי בקבוק בייצור קרנלים.

איפה זה נופל

הקוד כולו באנגלית ונוצר במיוחד עבור PyTorch 2.5.0, כך ששינויים בגרסאות פייתורץ' או בטריטון עלולים לשבור את התאימות של הקרנלים. קוד שלא הצליחו לייצר עבורו בדיקות יחידה סונן החוצה, מה שיוצר הטיה מובנית לטובת מודולים פשוטים או מבודדים יחסית. בנוסף, מדובר בקוד מכונה שנוצר על ידי מהדר ולא בקוד טריטון שנכתב על ידי בני אדם, ואיכות המקור תלויה במאגרים המקוריים שנדגמו מגיטהאב.

שאלות
נפוצות

האם מותר להשתמש במאגר לאימון מודל מסחרי?

הרישיון מציב תנאי של הדדיות מחקרית. אם אתם מאמנים מודל או משלבים אותו בשירות מסחרי, אתם מחויבים לאפשר ליוצרי המאגר ולחוקרים להשתמש בו לייצור פלטים ולהערכה בתנאים שווים למשתמשים רגילים.

איך נאספו הנתונים והאם הם עברו אימות?

הנתונים נלקחו ממאגרי גיטהאב מתוך The Stack v1 וחולצו למודולים נפרדים. כל מודול נבדק באמצעות בדיקת יחידה ייעודית, ורק קוד שעבר את הבדיקה הומר לטריטון באמצעות torch.compile.

האם יש במאגר תמיכה בעברית?

לא. המאגר מכיל אך ורק קוד תוכנה בפייתון ובטריטון, לצד שמות מאגרים ומטא דאטה טכני באנגלית.

איך טוענים

אין צורך באישור גישה מיוחד כדי להוריד את הקבצים. המידע מחולק לשני קבצים עיקריים שזמינים להורדה ישירה: קובץ JSON רגיל בשם dataset_permissive.json וקובץ Parquet בשם dataset_permissive.parquet שמתאים לעבודה מהירה עם פנדס. שדות המפתח שחשוב לבדוק בכל רשומה הם repo_name, sha, stars והרישיונות של קוד המקור.

from datasets import load_dataset

ds = load_dataset("GPUMODE/KernelBook")

הרישיון

המאגר מופץ תחת רישיון מותאם בשם June 9 Researcher Reciprocity License שדורש הדדיות מחקרית. מותר להשתמש, לנתח ולשתף לצורכי מחקר וניתוח מסחרי עם מתן קרדיט, אבל אם מאמנים עליו מודל או משפרים שירות בינה מלאכותית, אסור לחסום את יוצרי המאגר מלהריץ וליצור פלטים במודל שפותח. בנוסף, חובה לוודא את הרישיונות הפרטניים של המאגרים המקוריים המופיעים ברשומות.

הרישיון המלא ב־Hugging Face ↗