GPT
V

vllm-flash-attn3

קוד פתוח

kernels-communityapache-2.02025-08-05

  • kernels

חבילת קרנלים מהירה של תשומת לב לשימוש עם vLLM שחוסכת זמני חישוב יקרים. מורידים אותה כשרוצים להאיץ הרצה מקומית בלי לכתוב או לקמפל אופטימיזציות ידנית.

  • 14.7 GBמשקל הקבצים
  • 58,655הורדות בחודש
  • 43לייקים

מה זה

זהו אוסף קרנלים של FlashAttention 3 שנבנה במיוחד עבור ספריית kernels כדי להשתלב בתשתיות הסקה כמו vLLM. הוא כולל 115 קבצים במשקל כולל של 14.7 גיגה בייט, שמכילים מימושים מקומפלים של פונקציות קשב מתקדמות.

החבילה מספקת גישה ישירה לפונקציות כמו flash_attn_func, flash_attn_varlen_func לטיפול באורכים משתנים, ומימוש ייעודי לניהול זיכרון מטמון עם flash_attn_with_kvcache. במקום להסתמך על מימושי ברירת מחדל אטיים יותר, הקרנלים האלה ממוקדים בייעול העבודה של מאיצים גרפיים תחת עומסי עיבוד גדולים.

בכרטיס לא צורפו תוצאות ביצועים מספריות מוכנות, אך קיים סקריפט מדידה ייעודי שמאפשר לבחון את המהירות ישירות על החומרה שלכם באמצעות פקודת ההרצה של הספרייה.

מתאים ל

  • האצת שרתי vLLM

    שילוב קרנלים של FlashAttention 3 לקיצור זמני תגובה בזמן הסקה תחת עומס.

  • ניהול KV Cache יעיל

    עבודה עם הפונקציה הייעודית למטמון כדי לצמצם שימוש בזיכרון במנות גדולות.

  • עיבוד רצפים באורך משתנה

    הרצת flash_attn_varlen_func על בקשות מעורבות בלי לבזבז משאבי חישוב.

איפה זה נופל

המאגר הזה מוגדר כרגע תחת קטגוריית מודל, והמפתחים מזהירים מראש שמספטמבר 2026 מאגרים מהסוג הזה יימחקו מהתשתית. בנוסף, אין בכרטיס תיעוד מסודר של החומרה הנתמכת, גרסאות הדרייברים הנדרשות או תוצאות ביצועים מפורטות, כך שחובה לבצע בדיקות תאימות עצמאיות עם סקריפט הבנצ'מרק לפני שמחברים אותו למערכת פעילה.

שאלות
נפוצות

האם אפשר להשתמש בזה בתור מודל שפה עצמאי?

לא. מדובר בספריית קוד ממוטבת לחישוב פעולות קשב ולא במודל שמקבל טקסט ומחזיר תשובה. היא נועדה להשתלב בתוך סביבת ריצה קיימת כמו vLLM.

איך בודקים אם הקרנל בכלל משפר את הביצועים אצלי?

החבילה כוללת כלי בדיקה מובנה. מריצים את פקודת הבנצ'מרק של ספריית kernels ישירות על השרת כדי למדוד את הזמנים על המאיץ שלכם.

איך מריצים

כדי לעבוד עם הקרנל מתקינים את ספריית kernels בגרסה העדכנית ביותר, וטוענים את המודול ישירות בקוד פייתון לפי גרסה 1 שלו. משם מייבאים את הפונקציה הרצויה, למשל flash_attn_combine או flash_attn_with_kvcache, ומזינים את הנתונים ישירות לפונקציה.

מכיוון שמדובר בקרנלים שמיועדים להאצת מודלים ולא במודל שפה שעומד בפני עצמו, צריך מאיץ גרפי מתאים שתומך בהרחבות האלו. אם אין לכם שרת ייעודי שמריץ מודלים בכמויות ומצדיק את תחזוקת התשתית, עדיף להשתמש בנקודת קצה מנוהלת של ספק חיצוני.

pip install -U huggingface_hub
hf download kernels-community/vllm-flash-attn3

הקבצים

115 קבצים במאגר, 14.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים. התנאי היחיד הוא שמירה על הודעות זכויות היוצרים והצהרת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗