GPT
Q

Qwen3.6-27B-Text-NVFP4-MTP

קוד פתוח

sakamakismileapache-2.02026-04-25

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • qwen3.6

גרסת טקסט בלבד של מודל 27B המכוילת ל־NVFP4, שמחזירה לפעולה את מנגנון ה־MTP לטובת speculative decoding מהיר על חומרת Blackwell.

  • 17Bפרמטרים
  • 262,144טוקנים בהקשר
  • 18.3 GBמשקל הקבצים
  • 969,640הורדות בחודש

מה זה

הפרויקט הזה לוקח את המודל של Qwen ומנקה ממנו את רכיבי הראייה כדי לחסוך מקום, תוך כיול מחדש לפורמט NVFP4 של modelopt. הבעיה העיקרית בגרסאות קודמות הייתה שהמרה רגילה השמיטה את ראש ה־MTP, מה שביטל לגמרי את היכולת לייצר מספר טוקנים במקביל. כאן החזירו 15 שכבות טנזורים בפורמט bf16 ישירות לתוך המשקלים, כדי לאפשר שוב חיזוי ספקולטיבי בתוך vLLM.

בבדיקות ביצועים מול גרסת הבסיס, ההספק מזנק מ־119 טוקנים לשנייה ל־207 בריצה מקבילית על כרטיס RTX PRO 6000. המעבר לנתיב הישיר של modelopt יחד עם פענוח ספקולטיבי משלש כמעט את קצב יצירת הטקסט, ומגיע לממוצע של כשלושה עד ארבעה טוקנים מתקבלים בכל מעבר טיוטה.

מתאים ל

  • עיבוד מסמכים ארוכים

    חלון של 256 אלף טוקנים יחד עם האצת MTP מאפשרים לנתח קבצי טקסט עצומים בלי לשלם על זמני תגובה ארוכים.

  • שירותי שרור ו־API פנימי

    קצב ייצור של מעל 100 טוקנים לשנייה בבקשה בודדת הופך אותו למתאים למערכות שדורשות מענה מיידי למשתמש.

  • סביבות Blackwell מקומיות

    ניצול מלא של ליבות ה־NVFP4 על כרטיסי תחנות עבודה חדשים להורדת עלויות זיכרון בשרת בודד.

איפה זה נופל

המודל מוגבל לטקסט בלבד, כי רכיבי הראייה נמחקו פיזית מהקבצים כדי לחסוך נפח ומשאבים. מעבר לכך, התמיכה בשפות הרשמיות אינה כוללת עברית, כך שכל שימוש בשפה המקומית דורש בדיקה מוקדמת כדי לראות אם התחביר והתשובות מחזיקים מעמד. בנוסף, יש מגבלת זיכרון קשיחה בזמן ריצה במקביל, וניסיון להעלות ליותר משני רצפים בחלון הקשר מלא מביא לקריסת זיכרון שקטה בזמן העלייה.

שאלות
נפוצות

האם אפשר לשלוח למודל תמונות יחד עם הטקסט?

לא. שכבות הראייה נמחקו לגמרי כדי לפנות מקום למנגנון ה־MTP ולצמצם את גודל הקבצים, כך שהוא יודע לקבל ולהוציא טקסט בלבד.

האם המודל יעבוד על כרטיסי מסך מסדרת RTX 4090 או 3090?

הוא לא יספק את הביצועים שמופיעים במדידות. האופטימיזציה של NVFP4 בגרסת modelopt נבנתה במיוחד עבור ארכיטקטורת SM120 של סדרת Blackwell, וכרטיסים ישנים יותר לא ינצלו את נתיב הפענוח הזה.

איך מריצים

כדי להריץ אותו כמו שצריך, חייבים חומרת Blackwell של אנבידיה בארכיטקטורת SM120, כמו כרטיסי RTX PRO 6000 או RTX 5090 עם מספיק זיכרון. המשקלים עצמם דורשים כ־15 גיגהבייט זיכרון גרפי, אך להרצה עם חלון ההקשר המלא של 256 אלף טוקנים חובה להפעיל מטמון KV בפורמט FP8 ולהגביל את התור לשני רצפים מקבילים בלבד, אחרת vLLM יקרוס בעת בניית ה־CUDA graphs.

אם אין לכם כרטיס מסדרת Blackwell, אין טעם לנסות להריץ אותו מקומית. הפורמט הזה בנוי ישירות לפקודות החומרה החדשות, ועל חומרה ישנה יותר עדיף לפנות ל־API מנוהל שמחזיק את המודל המקורי.

from transformers import pipeline

pipe = pipeline("text-generation", model="sakamakismile/Qwen3.6-27B-Text-NVFP4-MTP")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. מותר להשתמש בו באופן מסחרי, לשנות את הקוד ולהפיץ אותו הלאה בתוך מוצרים, כל עוד שומרים על הודעות זכויות היוצרים וההצהרה המקורית של המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗