GPT
Q

RedHatAI/Qwen3.5-122B-A10B-NVFP4

קוד פתוח

RedHatAIרישיון לא דווח2026-03-17

  • safetensors
  • qwen3_5_moe
  • qwen
  • nvfp4
  • vllm

גרסה מכווצת לדיוק של 4 ביט של מודל תערובת מומחים גדול. היא חוסכת כשלושה רבעים מנפח הזיכרון בלי לאבד כמעט יכולות חישוב או ידע כללי.

  • 71Bפרמטרים
  • 262,144טוקנים בהקשר
  • 71.2 GBמשקל הקבצים
  • 33,341הורדות בחודש

מה זה

רד האט לקחו את המודל המקורי של Qwen ודחסו את המשקולות והאקטיבציות של השכבות הלינאריות לפורמט FP4 באמצעות llm-compressor. התוצאה היא משקל קבצים של 71.2 גיגה בייט במקום נפח עצום שהיה דורש מערך שרתים כבד בהרבה. המודל שומר על חלון הקשר ענקי של 262,144 טוקנים ותומך בטקסט, תמונות, קריאות לכלים וחיזוי מרובה טוקנים.

מבחני הביצועים מראים שהמחיר באיכות כמעט לא קיים. במבחן GSM8k Platinum המודל שומר על 95.37 לעומת 95.59 במקור, ב־MMLU-Pro הוא משיג 86.62 מול 86.96, וב־Math 500 הוא אפילו עקף מעט את המקור עם 84.80. שימור היכולות בכל המדדים שנבדקו עומד על מעל 98.6 אחוזים, מה שאומר שהכיבוץ ל־FP4 לא שבר את יכולות החשיבה והמתמטיקה שלו.

מתאים ל

  • פתרון בעיות מתמטיקה

    המודל שומר על ציון 95.37 ב־GSM8k וציון 84.80 ב־Math 500 גם בדיוק המכווץ.

  • ניתוח מסמכים ארוכים

    תמיכה מובנית בחלון הקשר של 262,144 טוקנים מאפשרת לקרוא קבצים גדולים בבת אחת.

  • הפעלת סוכנים וכלים

    תמיכה ישירה ב־tool use דרך vLLM עם פרסר ייעודי מאפשרת חיבור לפונקציות חיצוניות.

איפה זה נופל

למרות שהירידה במבחנים קטנה, AIME 2025 ספג ירידה של יותר מאחוז שלם ל־91.66, ו־Ifeval ירד ל־93.32. קוונטיזציה של אקטיבציות ל־4 ביט עלולה לייצר אי יציבות במשימות קצה עדינות שדורשות דיוק מילולי נוקשה. מעבר לזה, המודל מחייב שימוש בספריות ייעודיות כמו vLLM עם הגדרות ספציפיות כדי לפעול, ולא יעבוד בצורה פשוטה על כל תשתית הסקה סטנדרטית.

שאלות
נפוצות

האם המודל ירוץ על כרטיס גרפי ביתי פשוט?

לא. הקבצים לבדם שוקלים 71.2 גיגה בייט, ובשביל לטעון אותם יחד עם זיכרון ההקשר תצטרכו חומרת שרתים מקצועית בעלת נפח זיכרון וידאו גבוה ותמיכה ב־FP4.

מה ההבדל בין הרצה רגילה להרצה במצב טקסט בלבד?

הפקודה language-model-only מוותרת על טעינת מודול הראייה של התמונות, מה שמשחרר זיכרון וידאו פנוי לטובת שמירת הקשר שיחה ארוך יותר.

האם הכיבוץ ל־4 ביט פוגע באיכות התשובות?

הפגיעה זניחה לפי המבחנים, עם שמירה של מעל 98.6 אחוזים מהיכולות המקוריות במתמטיקה, ידע כללי ועמידה בהוראות.

איך מריצים

ההרצה נעשית ישירות דרך vLLM עם מנוע MoE מבוסס flashinfer_cutlass. אפשר להעלות אותו במצב טקסט בלבד כדי לחסוך זיכרון לטובת ה־KV cache, או להשאיר את התמיכה במולטימודל פעילה לעיבוד תמונות. המודל תומך גם בייצור ספקולטיבי עם שרת ה־vLLM כדי לזרז את התשובות.

בגלל שמדובר בפורמט NVFP4, צריך חומרת אנבידיה מודרנית שתומכת בחישובי FP4 בחומרה ולא תעשה להם אמולציה איטית. 71.2 גיגה בייט יחייבו כרטיסי שרת עם זיכרון וידאו נכבד, כך שאם אין לכם לפחות שרת עם זוג כרטיסי A100 או H100 זמינים, אין היגיון לנסות לדחוף אותו למחשב מקומי, ועדיף להישען על נקודת קצה מנוהלת.

pip install -U huggingface_hub
hf download RedHatAI/Qwen3.5-122B-A10B-NVFP4

הרישיון

הרישיון לא דווח בעמוד המודל. זה משאיר את המצב המשפטי בערפל, ואסור לשלב אותו בקוד ייצור או במוצר מסחרי לפני שבודקים את תנאי השימוש של מודל המקור וההפצה הזו של רד האט.

הרישיון המלא בעמוד המודל ↗