GPT
F

flashinfer-trace

קוד פתוח

flashinfer-aiapache-2.02025-09-07

מאגר מדידות ועומסי הרצה אמיתיים של קרנלים מתוך סביבות הסקה. הוא מיועד למי שמפתח ספריות ביצועים ורוצה להשוות מהירות מול מימושי ייחוס מדויקים.

  • 7,739הורדות בחודש
  • 20לייקים

מה זה

המאגר מכיל קובצי עבודה שמייצגים חישובי הסקה אמיתיים של מודלים, כמו שכבות תשומת לב בדחיסה ודלדול. הנתונים מחולקים להגדרות חישוביות שמגדירות את הפעולה המתמטית בקוד פייטשורץ, מימושים של מומחים או סוכנים, עומסי עבודה עם טנזורים בפועל, ותיעוד ביצועים שמודד מהירות ונכונות.

המבנה של המאגר ברמת הקבצים כולל אלפי קובצי safetensors שמכילים את הקלטים הממשיים, לצד קובצי json ו־jsonl שמחזיקים את המטא-דאטה והרישומים. הקלטים נלקחו ישירות מסביבות הסקה ומכילים צורות טנזורים ופרמטרים של ריצה אמיתית, ללא סינון ידני של טקסטים או מידע חוץ-חישובי.

מתאים ל

  • השוואת ביצועי קרנלים

    בדיקת זמני ריצה של קרנל מותאם מול מימושי ייחוס ומימושי מומחים קיימים.

  • אימות תקינות חישובית

    הרצת טנזורים אמיתיים כדי לבדוק שהתוצאה זהה בדיוק להגדרת הפייטשורץ.

  • אופטימיזציה לסביבות הסקה

    ניתוח צווארי בקבוק בחישוב שכבות תשומת לב מורכבות תחת עומסי שיא.

איפה זה נופל

זה לא מאגר לאימון מודלים של שפה ואין פה טקסט לקריאה או עברית. הנתונים מתאימים רק למי שמפתח שכבות חישוב ברמת חומרה או בודק יעילות של קרנלים. בנוסף, המדידות והעומסים משקפים ארכיטקטורות ספציפיות שנבדקו בסביבות הרצה מסוימות, ולא כל פעולת מודל קיימת נמצאת כאן. מי שבונה מנוע הסקה מותאם אישית יצטרך לבדוק שהגדלים והצורות של הטנזורים במאגר תואמים את התרחיש המדויק שלו, כי הכרטיס לא מכסה את כל סוגי החישובים בעולם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא אפאצ'י שתיים אפס והוא מתיר שימוש מסחרי מלא. צריך רק להקפיד לצרף את תנאי הרישיון והודעת זכויות היוצרים של היוצרים המקוריים.

האם יש במאגר נתונים בעברית או טקסט רגיל?

לא, אין בו טקסט בכלל באף שפה. המאגר מכיל אך ורק טנזורים, קובצי הגדרות של קרנלים ויומני ביצועים של ריצות חישוביות.

כמה קבצים יש במאגר ואיך הם מנוהלים?

המאגר כולל 5,996 קבצים, שרובם שמורים בפורמט safetensors ומכילים את נתוני הקלט של עומסי ההרצה. המטא-דאטה והתוצאות של הבדיקות שמורים בקובצי json ו־jsonl.

איך נאספו הנתונים שבמאגר?

הנתונים נדגמו מתוך סביבות פריסה אמיתיות של מערכות בינה מלאכותית בזמן הסקה. הם כוללים קלטים בפועל של פעולות חישוב לצד מדידות של ביצועים ונכונות מול מימוש ייחוס בפייטשורץ.

איך טוענים

המאגר פתוח לחלוטין ואין צורך לבקש אישור גישה מראש. אפשר למשוך אותו דרך ספריית הדאטהסטים הרגילה או ישירות באמצעות גיט, אבל קחו בחשבון שיש כאן 5,996 קבצים, רובם קובצי safetensors כבדים שמכילים משקלים וטנזורים של עומסי עבודה, כך שהורדה מלאה תיקח זמן ותדרוש נפח דיסק פנוי.

כדי לעבוד איתו צריך לנווט לפי הנתיבים המוגדרים של סוג הפעולה ושם המפתח. השדות המרכזיים בתוך קובצי הרישום כוללים את נתוני הקלט, נתוני הסביבה שבה נערכה הבדיקה, תוצאות המדידה ואימות התקינות החישובית מול קוד הייחוס.

from datasets import load_dataset

ds = load_dataset("flashinfer-ai/flashinfer-trace")

הרישיון

הרישיון הוא אפאצ'י שתיים אפס, מה שאומר שמותר להשתמש בו לפרויקטים מסחריים ומחקריים כאחד. הרישיון דורש שמירה על הודעת זכויות היוצרים ומסמך הרישיון המקורי בכל הפצה של הנתונים או קוד הנגזר מהם. אין דרישה לשתף קוד מקור של מוצר שנבנה בעזרתו, והוא לא כובל פיתוחים מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗