GPT
Q

Qwen3.6-27B-PrismaSCOUT-Blackwell-NVFP4-BF16-vllm

קוד פתוח

rdtandapache-2.02026-05-04

  • vllm
  • safetensors
  • qwen3_5
  • compressed-tensors
  • nvfp4

גרסה מכווצת של מודל שפה חזק בגודל ביניים, שמותאמת במיוחד לכרטיסי בלקוול של אנבידיה. מי שמחזיק בחומרה הזו מקבל שמירה טובה על דיוק המקור לצד פינוי מקום בזיכרון לזיכרון הקשר עמוק.

  • 15Bפרמטרים
  • 262,144טוקנים בהקשר
  • 18.8 GBמשקל הקבצים
  • 372,844הורדות בחודש

מה זה

מדובר במודל שנגזר מ־Qwen3.6-27B ומיועד להרצה בספריית vllm. הכיווץ משלב בין פורמט NVFP4 לבין משקלי BF16 שנשמרו בשכבות רגישות, לפי אלגוריתם שבדק סטייה שלמה מקצה לקצה במקום להעריך כל שכבה לבד. המטרה היא לצמצם את נפח המשקלים ל־20.17 גיגה־בייט בדיסק בלי לשבור את התנהגות המודל.

במבחני ביצועים מקומיים הוא מציג 96.66% התאמה מלאה ב־GSM8K, ציון של 85.4% ב־IFEval קפדני וציון 86.23% ב־MMLU בחמש דוגמאות. במבחן הפעלת כלים, tool-eval-bench, הוא הגיע ל־88 מתוך 100. המספרים האלה מראים שהמעבר לכיווץ חסכוני יותר כמעט לא פגע ביכולת הלוגית ביחס לגרסה הקודמת, ובמשימות של מעקב אחר הוראות יש אפילו שיפור קל.

מתאים ל

  • הפעלת כלים וסוכני אוטונומיה

    המודל השיג 88 מתוך 100 במבחן הכלים וכולל מפענח ייעודי לקריאות פונקציה, כך שסטיית הפורמט אינה שוברת את המבנה.

  • שרתי שירות בעומס גבוה

    צמצום המשקל ל־20.17 גיגה מפנה זיכרון יקר בכרטיס לטובת אצוות בקשות גדולות וניצול יעיל של חומרת בלקוול.

  • משימות חשיבה עם מעקב פקודות

    שילוב של 96.66% ב־GSM8K עם תמיכה בחיזוי ספקולטיבי מאפשר פתרון בעיות לוגיות בקצב יצירת טוקנים מהיר.

איפה זה נופל

החיסרון הברור ביותר הוא נעילת החומרה, שמונעת עבודה על כרטיסי מסך קודמים כמו דור הופר או עמדות פיתוח אישיות. בנוסף, אף שהאלגוריתם בחר נקודת עבודה מאוזנת, מדידת סטיית ה־KL המעודכנת על פני 4,088 עמדות עומדת על כ־0.078 מול מודל המקור, פי שניים כמעט מהגרסה החדשה יותר שנבנתה על בסיס Qwen3.8. אם המוצר שלכם נשען על קריאות מדויקות לפונקציות או ניסוחים עדינים מאוד, חשוב לבדוק את נקודות ההחלטה בפועל ולא להסתמך רק על תוצאות כלליות ב־GSM8K.

שאלות
נפוצות

האם אפשר להריץ את הקבצים על כרטיס H100 או כרטיס RTX ביתי?

לא. הארכיטקטורה הזו ממוטבת ומקודדת עבור יחידות NVFP4 שנמצאות בכרטיסי Blackwell בלבד. על כרטיסים ישנים יותר תצטרכו גרסאות בפורמטים אחרים, כמו MXFP4 שהובטח בהמשך.

איך המודל מתמודד עם הקשרים ארוכים בפועל?

חלון ההקשר התאורטי מגיע עד 262,144 טוקנים. החיסכון במשקל המודל משאיר מקום נרחב ל־KV cache בזיכרון ה־GPU, במיוחד בהפעלת אפשרות ה־fp8 שהוגדרה בפקודת השרת.

איך מריצים

המודל הזה דורש שרת עם כרטיסי מסך מסדרת NVIDIA Blackwell, בגלל התלות בחומרת NVFP4 ייעודית. פקודת ההרצה נשענת ישירות על מנוע vllm עם מנגנון compressed-tensors, תמיכה במטמון fp8 לשמירת הקשר ארוך והפעלת MTP עם שלושה טוקנים של חיזוי ספקולטיבי לטובת זמני תגובה מהירים יותר.

אם אין לכם גישה לכרטיסי בלקוול, אין טעם לנסות להריץ את הקבצים האלה. במקרה כזה, עדיף בהרבה להשתמש ב־API מנוהל שמגיש את המודל המקורי, או לחכות לגרסאות בפורמט MXFP4 שיתאימו לכרטיסים נפוצים יותר.

pip install -U huggingface_hub
hf download rdtand/Qwen3.6-27B-PrismaSCOUT-Blackwell-NVFP4-BF16-vllm

הרישיון

הרישיון הוא apache-2.0, רישיון קוד פתוח מתירני ומוכר. אפשר להשתמש במודל לצרכים מסחריים, לשלב אותו במוצרים שנמכרים ללקוחות ולשנות את הקבצים, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗