GPT
Q

Qwen3-Coder-Next-NVFP4

קוד פתוח

GadflyIIapache-2.02026-02-04

  • transformers
  • safetensors
  • qwen3_next
  • text-generation
  • qwen3

גרסה מכווצת של מודל קוד היברידי שחותכת את המשקל ב־70 אחוז. היא מאפשרת להריץ מודל של 80 מיליארד פרמטרים על חומרה מקומית חזקה בלי לוותר על רוב הדיוק.

  • 262,144טוקנים בהקשר
  • 44.3 GBמשקל הקבצים
  • 13,500הורדות בחודש
  • 45לייקים

מה זה

מדובר בכיבוץ NVFP4 של מודל קוד שמבוסס על ארכיטקטורה היברידית של DeltaNet לצד Attention ו־MoE. במקור הוא שוקל כ־149 גיגה-בייט, וכאן הוא יורד לכ־44.3 גיגה-בייט על פני 23 קבצים. יש לו 80 מיליארד פרמטרים בסך הכול, אבל בפועל רק 3 מיליארד מופעלים בכל טוקן דרך מנגנון מומחים, מה שאמור להאיץ את הריצה משמעותית ביחס למודלים צפופים.

מבחינת ביצועים, במבחן MMLU-Pro גרסת ה־BF16 המקורית קיבלה 52.90 אחוז, והגרסה הזו מגיעה ל־51.27 אחוז. זו ירידה של 1.63 אחוז בלבד, פשרה סבירה מאוד בהתחשב בירידה בנפח הזיכרון הנדרש. שכבות הליבה, כמו ניתוב המומחים והקשב הלינארי, נשארו ב־BF16 כדי למנוע קריסה באיכות הפלט.

מתאים ל

  • השלמת קוד מקומית

    מפעיל רק 3 מיליארד פרמטרים לטוקן ומאפשר מענה מהיר במערכות פיתוח פנימיות.

  • ניתוח בסיס קוד נרחב

    נבדק בהצלחה עד 128 אלף טוקנים ומתאים לפרויקטים גדולים שדורשים הקשר רחב.

  • עבודה ברשת סגורה

    רישיון חופשי ונפח של 45 גיגה שמאפשרים לפרוס כלי עזר למפתחים ללא ענן חיצוני.

איפה זה נופל

הכיול של הקוונטיזציה נעשה על בסיס 20 דוגמאות בלבד מתוך ultrachat_200k עם אורך רצף מקסימלי של 2048 טוקנים. זה מדגם זעיר שלא בהכרח מכסה מקרי קצה בקוד מורכב.

מעבר לכך, למרות שהחלון המקורי מוגדר ל־256 אלף טוקנים, בפועל הוא נבדק רק עד חצי מזה בגלל מגבלות חומרה. מי שבונה על חלונות ענקיים מקצה לקצה חייב לבדוק יציבות בעצמו.

שאלות
נפוצות

אפשר להריץ אותו על כרטיסי מסך רגילים?

לא. הפורמט דורש תמיכה ב־NVFP4, והוא מיועד לחומרה מתקדמת כמו כרטיסי Blackwell. בנוסף, תצטרכו לפחות שני כרטיסים במקביל כדי לטעון אותו עם הקשר סביר.

למה המודל נבדק רק עד 128 אלף טוקנים ולא 256 אלף?

החומרה שעליה נבדק המודל פשוט הגיעה למגבלת הזיכרון. למרות שהארכיטקטורה תומכת ב־262,144 טוקנים, שימוש בחלון המלא דורש עוד כרטיסים או זיכרון ייעודי למטמון.

איך הכיול הקצר משפיע על משימות תכנות?

הוא כויל עם 20 דוגמאות שיחה באורך קצר יחסית ולא על מאגרי קוד ענקיים. לכן כדאי לבדוק ביצועים על השפה וסביבת העבודה הספציפית שלכם לפני שמסתמכים עליו.

איך מריצים

כדי להריץ אותו בפועל צריך vLLM בגרסה 0.16.0 לפחות עם תמיכה ב־NVFP4, וספריית transformers בגרסה 5.0.0 ומעלה. ההרצה דורשת חומרה שתומכת בפורמט הזה, כמו סדרת Blackwell של Nvidia, ומערך של שני כרטיסים לפחות עם Tensor Parallel כדי להחזיק את המשקל ואת הזיכרון הפעיל.

בבדיקות הצליחו להגיע ל־128 אלף טוקנים עם זיכרון מטמון מסוג FP8, פשוט כי נגמר הזיכרון בכרטיסים כדי לנסות יותר. אם אין לכם שרת ייעודי כזה בבית או בענן, עדיף לפנות ל־API חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="GadflyII/Qwen3-Coder-Next-NVFP4")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא, בדיוק כמו במודל המקורי. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים פנימיים או חיצוניים בלי דרישה לפתוח את הקוד שלכם, בכפוף לשמירה על הודעות זכויות היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗