GPT
Q

RedHatAI/Qwen3.6-35B-A3B-NVFP4

קוד פתוח

RedHatAIapache-2.02026-04-17

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • fp4

גרסת קוונטיזציה של מודל MoE עם 35 מיליארד פרמטרים שנדחס לפורמט NVFP4. מי שמחפש אותו רוצה מודל חשיבה חזק שתופס רק 23.4 גיגה-בייט על חומרה תומכת.

  • 35Bפרמטרים
  • 262,144טוקנים בהקשר
  • 23.4 GBמשקל הקבצים
  • 953,068הורדות בחודש

מה זה

רד האט לקחו את המודל של קוון ודחסו גם את המשקולות וגם את האקטיבציות לפורמט NVFP4 באמצעות llm-compressor. המבנה הוא תערובת מומחים, מה שאומר שהוא מתאים במיוחד למערכות שבהן כוח החישוב גבוה מרוחב הפס של הזיכרון. המודל שומר על ביצועים טובים מאוד במתמטיקה וחשיבה מדעית, כשבמבחני GSM8k Platinum ו־GPQA Diamond הוא מציג דיוק של מעל מאה אחוזים ביחס למקור הלא מכווץ.

מצד שני, רואים פגיעה מורגשת כשמגיעים לכתיבת קוד ולפתרון בעיות תוכנה אמיתיות. במבחן SWEBench Verified התוצאה צונחת מ־54.8 במקור ל־50.2 בגרסה הזו, וגם בשיחות מרובות שלבי קריאות לפונקציות יש ירידה מסוימת בביצועים. הוא מצטיין בעיבוד טקסט ותמונות עם חלון של 262,144 טוקנים, אבל צריך לזכור שהדחיסה הזו גובה מחיר ביכולות ההנדסיות שלו.

מתאים ל

  • פתרון בעיות מתמטיות

    שומר על מעל 98 אחוז מהדיוק של המקור במבחני AIME ו־Math 500 ורץ מעולה על כרטיס בודד.

  • עוזר חשיבה ומענה

    מציג ציון של 92.45 ב־IFEval ועוקב היטב אחרי הנחיות מורכבות תוך שמירה על זיכרון נמוך.

  • סוכן לפקודות בודדות

    מחזיק 99.34 אחוז מיכולת קריאת הפונקציות המקורית בסבב בודד, מה שמתאים לניתוב שאילתות מהיר.

איפה זה נופל

יוצרי המודל מבהירים שמדובר בגרסה ראשונית שצפויה להשתנות, כך שלא בטוח שכדאי להסתמך עליה בייצור יציב. מעבר לזה, הבדיקות של רד האט נעשו עם הדגל language-model-only, מה שאומר שיכולות התמונה לא נבדקו במדידות האלה. החולשה המרכזית שלו היא בקוד מורכב ובמשימות מרובות שלבים, שם הוא מאבד כמעט עשרה אחוזים מהיכולת של המקור. חובה להריץ עליו מבחנים ממוקדים על הנתונים שלכם לפני שמשלבים אותו בזרימת עבודה אמיתית.

שאלות
נפוצות

האם המודל תומך בעיבוד תמונות בהרצה מקומית?

הארכיטקטורה מוגדרת למשימות תמונה וטקסט, אבל המפרסמים בדקו אותו בבנצ'מרקים עם דגל שמפעיל טקסט בלבד. אם המטרה היא ראייה ממוחשבת, צריך לבדוק ידנית שהוא עובד תחת vLLM בתצורה הזו.

למה התוצאות שלו במתמטיקה גבוהות יותר מהמודל המקורי?

בבדיקות כמו GSM8K נרשמה תוצאה של 96.08 לעומת 95.73 במקור. סטיות קלות כאלה קורות לפעמים בגלל דגימה סטוכסטית בטמפרטורה 1.0 והשפעת הקוונטיזציה על מסלולי הניתוב של המומחים.

איך מריצים

ההרצה נעשית דרך vLLM מהענף הראשי עם תמיכה ב־NVFP4, באמצעות הדגל flashinfer_cutlass למנגנון המומחים והגדרה של מנתח חשיבה. הקבצים שוקלים 23.4 גיגה-בייט, כך שכרטיס מסך מודרני בודד בעל נפח זיכרון מתאים ותמיכה בפורמט הזה יחזיק אותו בלי בעיה. בבדיקות הביצועים הרשמיות הגבילו את אורך המודל ל־96,000 טוקנים כדי לעמוד בעומסים.

אם אין לכם כרטיסי מסך חדשים שתומכים בחומרה בפורמט NVFP4, אין טעם להוריד את המשקלים האלה. במצב כזה עדיף לפנות ל־API חיצוני שמארח את מודל המקור, או להשתמש בגרסאות קוונטיזציה נפוצות יותר כמו FP8 או INT4 שנתמכות על חומרה וותיקה יותר.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="RedHatAI/Qwen3.6-35B-A3B-NVFP4")
print(pipe("שלום"))

הקבצים

87 קבצים במאגר, 23.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של המשקולות והפצה חופשית בתוך מוצרים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗