GPT
Q

Qwen3.8-27B-NVFP4-RTX5090

קוד פתוח

gittensor-model-hubapache-2.02026-08-14

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • nvfp4

גרסת NVFP4 מותאמת לכרטיסי בלקוול שמאפשרת להריץ מודל 27B בהקשר מלא על כרטיס יחיד. הבחירה בה הגיונית למי שמחזיק RTX 5090 ורוצה מהירויות כתיבה גבוהות בלי לפצל חומרה.

  • 15Bפרמטרים
  • 262,144טוקנים בהקשר
  • 16.7 GBמשקל הקבצים
  • 610,419הורדות בחודש

מה זה

מדובר בכיול NVFP4 למודל Qwen3.8-27B של עליבאבא, שכוון ספציפית לעבודה על ארכיטקטורת בלקוול של אנבידיה. המודל מתמודד עם טקסט, תמונות ווידאו, ומציע חלון הקשר מלא של 262,144 טוקנים ישירות על זיכרון של 32 גיגה בייט. בניגוד לגרסאות מקבילות שמשאירות חלקים גדולים בדיוק גבוה יותר, כאן כווצו גם שכבות הליבה וראש הפלט, וראש ה־MTP המקורי הוסר לחלוטין כדי לפנות מקום בזיכרון.

המשמעות של הכיול הזה בפועל אינה פגיעה באיכות, שעומדת על 79% במבחנים רב־תחומיים זהה למקור, אלא תוספת מקום מסיבית להקשר ומהירות פענוח. במנוע SparkInfer הוא מגיע לכ־93 טוקנים לשנייה בלי עזרים, ועם מודל טיוטה ייעודי מגיע לקצב חריג בכתיבת קוד. המטרה כאן ברורה, מקסימום ביצועים מחומרה ביתית מתקדמת בלי לאבד את החלון הארוך.

מתאים ל

  • פיתוח ויצירת קוד מקומי

    מגיע לקצב חריג של מאות טוקנים לשנייה בכתיבת קוד על גבי כרטיס יחיד עם מודל טיוטה ייעודי.

  • ניתוח מסמכים ואודיט ארוך

    מאפשר טעינת הקשר מלא של מעל 250 אלף טוקנים בזיכרון של 32 גיגה בייט בלי לקרוס מחוסר מקום.

  • סוכנים מבוססי כלים ב־JSON

    תבנית השיחה תומכת בקריאות כלים ישירות בפורמט מחרוזת ומייצרת פלט מובנה במהירות גבוהה.

איפה זה נופל

הנקודה החלשה ביותר היא עבודה מול קהל משתמשים רחב. ב־16 פניות במקביל המהירות לכל משתמש צונחת לאזור 22 טוקנים לשנייה, ושרת vLLM עוקף את SparkInfer בערך פי 1.6 בתרחישים כאלה. בנוסף, האצת הפענוח באמצעות טיוטה דורשת כרגע שימוש במנוע SGLang כי ב־SparkInfer היא זמינה רק בכלי הבדיקה ולא בשרת ה־HTTP.

יש גם באג דיווח בממשק, שבו השרת מצהיר על תמיכה בטקסט ותמונה בלבד למרות שווידאו עובד בפועל, מה שעלול לשבור ספריות סוכנים שבודקות יכולות מראש. שילוב של טיוטה מוריד את תקרת ההקשר המעשית מ־320 אלף טוקנים לכ־165 אלף.

שאלות
נפוצות

האם המודל יעבוד על כרטיסי RTX 4090 או כרטיסי דור קודם?

לא. הפורמט NVFP4 מחייב ליבות טנזור של ארכיטקטורת בלקוול, שקיימות בכרטיסי RTX 5090 ומעלה. כרטיסים ישנים יותר לא יצליחו לבצע חישובי FP4 גם אם הקבצים ייטענו לזיכרון.

איך אפשר לקבל תשובות קצרות בלי שהמודל יבזבז זמן על חשיבה?

אפשר לכבות את מנגנון החשיבה ישירות בקריאה על ידי העברת הפרמטר enable_thinking במצב false בתוך ארגומנטי התבנית. לחלופין, שמירה על דרגת חשיבה xhigh דווקא מקצרת את מספר הטוקנים ביחס להגדרות בינוניות.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך מסדרת בלקוול עם 32 גיגה בייט זיכרון, דוגמת RTX 5090. כרטיסי הופר וכרטיסים ישנים יותר מסוגלים לטעון את המשקלים אך לא להריץ את פורמט ה־NVFP4. המודל רץ ישירות מתוך קונטיינר דוקר של SparkInfer שמוריד את המשקלים לבד ומאפשר קריאות תואמות OpenAI, או דרך מנועי SGLang ו־vLLM בגרסאות עדכניות.

אם אתם צריכים לשרת עשרות משתמשים במקביל תחת עומס קבוע, שרתי ענן או שירותי API מנוהלים יהיו יעילים יותר. המודל הזה מתוכנן לסחוט את המיץ מזרם בודד או עומס של עד שמונה פניות מקבילות בכרטיס מקומי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="gittensor-model-hub/Qwen3.8-27B-NVFP4-RTX5090")
print(pipe("שלום"))

הרישיון

המשקלים מופצים תחת רישיון אפאצ'י 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי, הפצה ושילוב במוצרים סגורים בלי תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים המקורית ומצרפים את נוסח הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗