GPT
Q

Qwen3.8-27B-nvfp4-NInfer

קוד פתוח

nerouedapache-2.02026-08-06

  • ninfer
  • qwen3.8
  • nvfp4
  • fp8
  • w4a4

גרסת NVFP4 מותאמת לכרטיס RTX 5090 ומנוע NInfer. מי שיריץ אותה מקבל מודל של 27 מיליארד פרמטרים עם ביצועי שפה וראייה מהירים על חומרה מקומית.

  • 22.1 GBמשקל הקבצים
  • 54,122הורדות בחודש
  • 51לייקים

מה זה

הקובץ הזה מאחד את משקלי הטקסט המכווצים מבית Unsloth יחד עם משקלי הראייה והבקרה של המודל המקורי, בתוך מארז ייעודי למנוע NInfer. הוא מעבד טקסט לצד תמונות ווידאו, ומציע פענוח ספקולטיבי באמצעות MTP או DFlash2 כדי להאיץ את מהירות הפליטה. החלוקה הפנימית משלבת שכבות NVFP4 לצד חישובי FP8 ו־BF16 ברמת הראייה וההטמעה.

במדדי ההערכה, המודל שומר על דיוק קרוב מאוד למקור הלא מכווץ. במבחני AIME 2025 ו־2026 הוא פתר 29 מתוך 30 בעיות, ובמדד GPQA-Diamond קיבל 90.40% לעומת 89.2% במקור. הנקודה החלשה יחסית היא משימות ציות להוראות מדויקות ב־IFBench, שם נרשמה ירידה מ־79.5% ל־77% בהשוואה למודל המלא. במבחני מהירות עם פענוח ספקולטיבי MTP3, הפליטה הגיעה ל־219.8 טוקנים לשנייה ביצירת פלט מובנה ו־194.3 טוקנים לשנייה בקוד.

מתאים ל

  • יצירת קוד ומבני נתונים

    מייצר פלטי JSON וקוד במהירות גבוהה של עד 219 טוקנים לשנייה עם אחוזי קבלת ספקולציה גבוהים.

  • ניתוח מסמכים ותמונות

    מעבד תמונות ווידאו ישירות במודל יחד עם חלון הקשר נרחב של עד 240,000 טוקנים.

  • פתרון בעיות מתמטיות

    מציג דיוק של מעל 96% במבחני AIME בזכות תמיכה במצב חשיבה עמוקה.

איפה זה נופל

הקובץ לא עובד עם ספריות נפוצות כמו Transformers, vLLM או קובצי GGUF של llama.cpp, אלא אך ורק בתוך NInfer מגרסה מסוימת ומעלה. החומרה מוגבלת לחלוטין לכרטיס RTX 5090 בודד, ללא אפשרות לפצל על פני כמה כרטיסים, ללא מנגנון continuous batching ארגוני וללא פריקת זיכרון ל־CPU. בנוסף, המנוע לא מריץ בעצמו קריאות לפונקציות וכלים שנוצרו בפלט, כך שתצטרכו לתפוס ולבצע אותן ידנית בקוד שלכם. תחת עומס של שמונה בקשות במקביל קצב העבודה הכולל צונח עקב לחץ זיכרון, וביצועי פענוח ספקולטיבי בטקסטים ספרותיים יורדים לקצב של 126 טוקנים לשנייה בלבד.

שאלות
נפוצות

האם אפשר להריץ את המודל דרך Ollama או llama.cpp?

לא. הקובץ מופץ בפורמט פנימי של NInfer ולא בפורמט GGUF או משקלים רגילים של Hugging Face. המנוע היחיד שמסוגל לטעון אותו כרגע הוא NInfer שנבנה מקוד המקור.

האם אפשר להשתמש במודל עם כרטיסי מסך ישנים יותר כמו RTX 4090?

דרישות המערכת מציינות במפורש כרטיס מדור RTX 5090 עם תמיכה בארכיטקטורת sm_120a ו־CUDA 13.1. כרטיסים ישנים יותר אינם נתמכים בקובץ ההרצה הזה.

איך המודל מצליח להיכנס לכרטיס צרכני יחיד?

המשקלים משלבים דיוק של 4 ביט בשיטת NVFP4 עבור שכבות ה־MLP עם שכבות FP8 לחלקים אחרים. כיווץ זה חוסך זיכרון ומאפשר ריצה מלאה של מודל בגודל 27 מיליארד פרמטרים על גבי 24 גיגהבייט זיכרון.

איך מריצים

כדי להריץ אותו צריך לינוקס 64 ביט, כרטיס מסך יחיד מדגם NVIDIA GeForce RTX 5090 עם ארכיטקטורת sm_120a, וערכת פיתוח CUDA 13.1 ומעלה. אין חבילת התקנה מוכנה בפייפ, אלא בונים את NInfer ישירות מקוד המקור בגיטהאב ומורידים את קובץ הארטיפקט ששוקל קצת מעל 22 גיגהבייט.

השרת המקומי פותח ממשקי API תואמי OpenAI ואנתרופיק, אך תומך בעומס קטן בלבד של עד שמונה בקשות פעילות במקביל. אם אין לכם את כרטיס המסך הספציפי הזה, או אם אתם צריכים לשרת מאות משתמשים בו־זמנית עם ניהול תורים מורכב, פנייה ל־API מנוהל בענן תהיה מעשית וזולה בהרבה.

pip install -U huggingface_hub
hf download neroued/Qwen3.8-27B-nvfp4-NInfer

הקבצים

6 קבצים במאגר, 22.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0, וכך גם המודלים שעליהם הוא מתבסס. הרישיון מתיר שימוש מסחרי, שינוי קוד והפצה חופשית בתוך מוצרים. התנאי העיקרי הוא שמירת הודעות זכויות היוצרים וכתב הוויתור על אחריות בכל עותק או שירות שמבוסס עליו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗