GPT
Q

Qwen3.8-27B-MTP-NVFP4

קוד פתוח

sakamakismileapache-2.02026-08-14

  • vllm
  • safetensors
  • qwen3_5
  • nvfp4
  • compressed-tensors

גרסת קוונטיזציה של מודל 27B עם ארכיטקטורה היברידית, שמצליחה לרדת ל־19.2 גיגה-בייט. המטרה כאן היא מהירות הפקה גבוהה על חומרת בלקוול הודות לשימור ראש חיזוי מובנה.

  • 27Bפרמטרים
  • 262,144טוקנים בהקשר
  • 19.2 GBמשקל הקבצים
  • 109,079הורדות בחודש

מה זה

הגרסה הזו דוחסת את המודל המקורי מ־55.6 גיגה-בייט בפורמט bf16 אל משקל של כ־20 גיגה-בייט בלבד באמצעות קוונטיזציית NVFP4, כלומר ארבעה ביטים למשקלים ולאקטיבציות. הארכיטקטורה משלבת שכבות DeltaNet עם מנגנון קשב מלא, ומכילה גם רכיב ראייה שנשמר במלואו יחד עם שכבות ה־conv1d וראש הניבוי המקבילי.

במקום להקריב ביצועים לטובת הדחיסה, ראש החיזוי Speculative Decoding המובנה נשמר בדיוק המקורי שלו. בפועל, בבדיקות עם ארבעה מעבדים גרפיים, השימוש בראש הניבוי הזה מעלה את קצב ההפקה של פלט יחיד מ־49 טוקנים לשנייה ליותר מ־72 טוקנים לשנייה, ומגיע עד ל־386 טוקנים לשנייה בעומס של שמונה בקשות במקביל.

מתאים ל

  • הסקה מהירה בחומרת בלקוול

    מנצל מנגנון ניבוי מובנה כדי לחצות 72 טוקנים לשנייה בזרם יחיד על כרטיסי 16GB.

  • עיבוד טקסטים ארוכים

    קצב טעינה של אלפי טוקנים לשנייה בבדיקות פרומפטים של עד מאה אלף טוקנים.

  • הפעלת כלים וסוכנים

    תומך בפיענוח חשיבה ובקריאות לכלים בפורמט ייעודי ישירות מול מנוע ההרצה.

איפה זה נופל

ברירת המחדל של מאמץ החשיבה מוגדרת למקסימום, ובמשימות יצירה ארוכות שלבי ה־think עלולים לשרוף עשרות אלפי טוקנים בלי לפלוט אפילו תו אחד של תשובה. חובה להוריד את רמת החשיבה לבינונית בהגדרות השיחה, ולהקצות מראש מעל 4096 טוקנים לתשובה.

בנוסף, אם מסירים בטעות את מודולי ה־MTP מקובץ ההגדרות, ראש החיזוי נהרס בשקט והמודל עובד לאט יותר מאשר בלי ניבוי בכלל. למרות שרכיב הראייה נשמר בדיוק מלא, המפרסם בדק רק הפקה של טקסט ולא בחן עיבוד תמונה או וידאו.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיסים מהדור הקודם כמו RTX 3090 או 4090?

לא. הדחיסה כאן היא מסוג NVFP4 שדורשת תמיכה בחומרת Blackwell, וניסיון להריץ אותו על ארכיטקטורות קודמות עם W4A16 ייכשל בשגיאה של vLLM.

למה המודל חושב המון זמן ולא מוציא שום תשובה?

המודל מגיע עם רמת חשיבה מוגזמת כברירת מחדל שעלולה לשרוף 32 אלף טוקנים על שלב המחשבה לבדו. שנו את reasoning_effort ל־medium בתבנית השיחה והקצו לפחות 4096 טוקנים ליציאה.

איך מריצים

כדי להריץ אותו צריך חומרת Blackwell שתומכת ב־NVFP4, כמו ארבעה כרטיסי RTX PRO 2000 של 16 גיגה-בייט עם חלוקת Tensor Parallelism ל־4. ההרצה נעשית ישירות ב־vLLM מגרסה 0.22 ומעלה, שמזהה את הטנסורים הדחוסים אוטומטית ללא צורך בדגל מיוחד, תוך שימוש במטמון fp8 עבור ה־KV.

אם אין לכם כרטיסי בלקוול, אין טעם לנסות להרים אותו מקומית כי ארכיטקטורת W4A16 פשוט קורסת כאן בשל מגבלות גודל אריחים, ורק W4A4 נתמך. במצב כזה עדיף לשלם לפי טוקן לספק ענן חיצוני שמחזיק את החומרה המתאימה.

pip install -U huggingface_hub
hf download sakamakismile/Qwen3.8-27B-MTP-NVFP4

הרישיון

הרישיון הוא Apache 2.0. הוא מאפשר שימוש מסחרי מלא, שינוי של הקבצים והפצה שלהם בתוך מוצרים. התנאי היחיד הוא שמירה על הצהרת זכויות היוצרים והודעת הרישיון המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗