GPT
Q

Qwen3.8-Flash-Next-NVFP4

קוד פתוח

RadixArkother2026-08-25

  • Model Optimizer
  • safetensors
  • qwen4_exp
  • ModelOpt
  • Qwen3.8

גרסה מכווצת של מודל ענק שמאפשרת להריץ חשיבה מולטימודלית כבדה על שרת בודד. היא חותכת את המשקל מ־360 ל־135 גיגה בלי לשבור את הביצועים במתמטיקה.

  • 120Bפרמטרים
  • 262,144טוקנים בהקשר
  • 126 GBמשקל הקבצים
  • 244,821הורדות בחודש

מה זה

מדובר בגרסת קוונטיזציה של מודל תערובת מומחים שכולל כ־180 מיליארד פרמטרים במקור, עם חלון הקשר עצום של 262 אלף טוקנים ותמיכה בטקסט, תמונה ווידאו. הכיווץ כאן נקודתי מאוד. הוא נוגע רק למומחים המנותבים בשכבות הראשיות ועובר לדיוק NVFP4 W4A4, בזמן שכל מנגנוני הקשב, הראייה והשכבות המשותפות נשארים ב־BF16 מלא ללא שינוי.

במבחני חשיבה ומתמטיקה קשים, המודל כמעט ולא סופג ירידה. ב־GSM8K הוא מציג 97.27 אחוזי דיוק לעומת כ־97.3 במקור, וב־AIME הוא משיג 98.75 אחוזי מעבר בניסיון ראשון. זה אומר שכושר החישוב הלוגי נשמר ברמה גבוהה מאוד, אבל בכרטיס מציינים שבמשימות סוכנים ארוכות הפלט נוטה להימרח ולהיות ארוך יותר מאשר במודל המקורי.

מתאים ל

  • פתרון בעיות מתמטיות

    הוא משיג 98.75 אחוז ב־AIME ומציע רמת דיוק כמעט זהה למקור BF16 בנפח קטן בהרבה.

  • ניתוח מסמכים ווידאו ארוכים

    חלון של 262 אלף טוקנים עם תמיכה במולטימודל מאפשר לעבד קבצי וידאו כבדים בבת אחת.

  • הסקה מרובת מומחים בשרת בודד

    כיווץ ל־135 גיגה מאפשר להריץ ארכיטקטורה של 180 מיליארד פרמטרים על שני כרטיסי Blackwell בלבד.

איפה זה נופל

המודל נשען על נתוני אינטרנט גולמיים ועלול לפלוט הטיות ותוכן פוגעני, בייחוד מול פרומפטים שדוחפים אותו לשם, אך גם בשאילתות רגילות הוא עשוי לייצר תשובות לא מדויקות או להחסיר פרטים. בנוסף, הקוונטיזציה גורמת לו להאריך תגובות שלא לצורך בריצות סוכנים ממושכות, מה שמנפח שימוש בטוקנים וזמני ריצה. הכיול עצמו בוצע על מדגם קטן מאוד של 128 כתבות בלבד, כך שיש לבדוק היטב התנהגות מול קלט מורכב לפני הטמעה.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיסי Hopper או פחות?

לא. התאימות נבדקה ואושרה רק עבור ארכיטקטורת Blackwell של NVIDIA עם פורמט NVFP4, כך שכרטיסים ישנים יותר לא יתמכו בהרצה הזו.

כמה זיכרון בפועל נחסך כאן?

הכיווץ חותך את גודל המשקלים מ־360 גיגה במקור ל־135 גיגה, ירידה של בערך פי 2.7 בנפח האחסון והזיכרון הראשוני הנדרש.

איך מריצים

המודל הזה דורש חומרה מסדרת Blackwell של NVIDIA כמו שרתי GB300 או B300, ומנוע הרצה של SGLang שנבנה עם תמיכה בארכיטקטורת המקור. ההרצה דורשת חלוקה על לפחות שני כרטיסים באמצעות FlashInfer Cutlass, הקצאת זיכרון סטטי גבוהה וניהול זיכרון של 135 גיגה לקבצים בלבד לפני טעינת ההקשר.

אם אין לכם גישה ישירה לשרתי Blackwell מקומיים או בענן ייעודי, אין טעם לנסות להוריד את 419 הקבצים האלה. במקרה כזה עדיף לחפש ספק API שמארח את המודל המקורי או את הגרסה הזו, ולשלם לפי טוקן במקום לתחזק מכונה יקרה כל כך.

pip install -U huggingface_hub
hf download RadixArk/Qwen3.8-Flash-Next-NVFP4

הקבצים

419 קבצים במאגר, 126 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר בתור other ומפנה לתנאים של מודל המקור Qwen3.8-Flash-Next. אין פירוט ישיר בקובץ לגבי שימוש מסחרי מותר או מגבלות הפצה, ולכן חובה לבדוק את תנאי המקור לפני שמשלבים את המשקלים במוצר חי.

הרישיון המלא בעמוד המודל ↗