GPT
Q

Qwen3.8-27B-QUASAR-NVFP4

קוד פתוח

QUASAR-QATרישיון לא דווח2026-08-23

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • nvfp4

גרסת קוונטיזציה אגרסיבית של מודל מולטימודלי 28B, שמכווצת אותו ל־19.2 גיגה בלי לפרק את הביצועים. פתרון ממוקד למי שמחזיק חומרת Blackwell ורוצה ביצועי מקור בעלות זיכרון נמוכה.

  • 28Bפרמטרים
  • 262,144טוקנים בהקשר
  • 19.2 GBמשקל הקבצים
  • 24,813הורדות בחודש

מה זה

מדובר במודל ראייה ושפה של 28 מיליארד פרמטרים שעבר אימון מודע קוונטיזציה בשיטת QUASAR. במקום סתם לעגל משקלים בסוף התהליך, המודל אומן בזיקוק ישיר מול גרסת המקור בפורמט bfloat16 על פני 2,446 צעדים, כדי למנוע את הבריחה מאיכות הבסיס.

ההבדל המשמעותי מול גרסאות NVFP4 אחרות בשוק הוא שכול 496 השכבות הלינאריות עברו כאן כיווץ מלא ל־4 ביט, כולל מנגנוני ה־attention וה־delta-net שבדרך כלל משאירים ב־FP8 כדי שהמודל לא יקרוס. התוצאה היא משקל של פחות מ־20 גיגהבייט.

במבחני AIME26 המודל שמר על ציון מושלם של 1.0000 בדיוק כמו מודל המקור השמן, וב־GPQA-Diamond ירד מ־0.9141 ל־0.9091 בלבד. הוא עוקף בבירור גרסאות מקבילות ששוקלות מעל 23 גיגהבייט ומשאירות חלקים נרחבים בדיוק גבוה.

מתאים ל

  • פתרון בעיות מתמטיקה ומדע

    הוא שומר על ציון מושלם ב־AIME26 וציון כמעט זהה למקור ב־GPQA, בנפח אחסון של 19.2 גיגה בלבד.

  • הסקה על כרטיס 32GB יחיד

    המשקל הנמוך מאפשר להריץ מודל 28B על חומרה צרכנית מדור Blackwell עם חלון הקשר של 64K.

  • תשתיות ענן עתירות תעבורה

    מבנה ה־W4A4 המלא מוריד את צוואר הבקבוק בזיכרון ומאפשר לחסוך משאבים בשרתי vLLM תואמים.

איפה זה נופל

המגבלה הכי קשה היא דרישת הברזל לחומרה. על כרטיסי דור קודם כמו Hopper או Ada Lovelace הוא פשוט לא יעלה בגלל היעדר תמיכה טבעית ב־NVFP4. מעבר לזה, כרטיס המודל מציג ציונים רק על שני מבחנים מתמטיים ומדעיים, AIME26 ו־GPQA, ואין שום תיעוד למדידות בתחומי הראייה והתמונה או יכולות שיחה כלליות. אם אתם בונים על עיבוד תמונות, תצטרכו לבדוק בעצמכם האם הדיוק נשמר גם שם.

שאלות
נפוצות

אפשר להריץ את המודל על RTX 4090 או כרטיס A100?

לא. המודל דורש תמיכת חומרה ב־NVFP4 שקיימת רק בארכיטקטורת Blackwell של אנבידיה עם compute capability 10.0 ומעלה. כרטיסים מדורות קודמים לא תומכים בפורמט הזה להרצה מהירה.

איך הוא שומר על איכות כמעט זהה למקור למרות כיווץ מלא?

הוא עבר אימון זיקוק בשיטת QUASAR מול מודל המקור, שבו המשקלים למדו לפצות על אובדן המידע של הקוונטיזציה בזמן אמת. זה שונה מקוונטיזציה פסיבית רגילה שרק חותכת ערכים אחרי האימון.

האם אפשר להשתמש בחלון ההקשר המלא של 262K על כרטיס יחיד?

לא בכרטיסי 32 גיגהבייט. על מנת לפתוח את כל חלון ההקשר תצטרכו שרת עם זיכרון משמעותי יותר, בעוד שעל כרטיס כמו RTX 5090 תיאלצו להגביל את ההקשר ל־65,536 טוקנים.

איך מריצים

מריצים אותו ישר דרך vLLM מגרסה 0.27 ומעלה, ללא שלבי המרה מוקדמים. הפקודה כוללת תמיכה ב־speculative decoding עם שרשור של 2 טוקנים. החיסרון הגדול: אתם חייבים כרטיס מסך מבוסס ארכיטקטורת Blackwell של אנבידיה שתומך ב־FP4 ברמת חומרה, כלומר compute capability 10.0 ומעלה.

אם יש לכם כרטיס של 32 גיגהבייט כמו RTX 5090, לא תוכלו לנצל את כל חלון ההקשר המלא של 262,144 טוקנים, ותצטרכו להגביל אותו ל־65,536 טוקנים כדי לא לחרוג מה־VRAM. למי שאין שרתים מהדור החדש הזה בארגון, אין בכלל מה לנסות להרים אותו מקומית, ועדיף לשלם על API חיצוני.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="QUASAR-QAT/Qwen3.8-27B-QUASAR-NVFP4")
print(pipe("שלום"))

הרישיון

הרישיון לא דווח בעמוד המודל. מבחינה משפטית, זה אומר שאין לכם היתר שימוש מוגדר, לא למחקר ובטח שלא להטמעה מסחרית במוצר שלכם. עד שהיוצרים לא יעדכנו תנאי שימוש ברורים, כל שילוב שלו במערכת ייצור חושף אתכם לתביעות זכויות יוצרים.

הרישיון המלא בעמוד המודל ↗