GPT
Q

Qwen3.8-27B-NInfer

קוד פתוח

nerouedapache-2.02026-08-06

  • ninfer
  • qwen3.8
  • multimodal
  • conversational
  • cuda

המודל הזה הוא המרה של מודל מולטימודלי בגודל 27B לפורמט קנייני שרץ ישירות על כרטיס RTX 5090 יחיד. מי שיבחר בו מחפש ביצועים של מודל גדול בהסקה מקומית בלי לפצל זיכרון לכמה כרטיסים.

  • 19.0 GBמשקל הקבצים
  • 29,691הורדות בחודש
  • 45לייקים

מה זה

מדובר בהמרה של Qwen3.8-27B לפורמט של מנוע ההסקה NInfer, שנועד לקחת משקלים כבדים ולדחוס אותם בכימות מעורב של 4, 5 ו־6 ביטים, יחד עם ראשי יציאה ו־embedding ב־8 ביטים. הקובץ מכיל בתוכו את כל מה שצריך לעיבוד טקסט, תמונות ווידאו, לצד משקלי עזר של MTP ו־DFlash2 שמאפשרים פענוח ספקולטיבי כדי להאיץ את מהירות הפליטה של הטוקנים.

במבחני הביצועים הוא כמעט לא מאבד כוח לעומת גרסת ה־BF16 המקורית, עם ירידה קטנה של פחות משתי נקודות ב־GPQA-Diamond לתוצאה של 87.37%, וציון של 77.67% ב־IFBench. במבחני המתמטיקה של AIME לשנים 2025 ו־2026 הוא פתר 29 מתוך 30 בעיות, שזה 96.67%. היכולת המולטימודלית שלו נשמרת היטב עם 82.22% ב־RealWorldQA.

מתאים ל

  • פתרון בעיות מתמטיקה

    הוא מגיע לדיוק של 96.67% במבחני AIME, מה שמתאים לניתוח חישובי מורכב ומשימות חשיבה מעמיקות.

  • ניתוח מסמכים ומדיה

    הוא תומך בעיבוד תמונות, וידאו וטקסט בתוך הקשר של עד 240,000 טוקנים בסרווינג מקומי.

  • שרת מקומי דל תקציב

    הוא מאפשר להריץ מודל 27B שלם על כרטיס יחיד עם תאימות לממשקי API של OpenAI.

איפה זה נופל

המגבלה הכי קשה היא הנעילה לחומרה ולתוכנה ספציפיות. הוא עובד על כרטיס 5090 בודד, בלי יכולת לפצל לכמה כרטיסי מסך, בלי Continuous Batching בקנה מידה רחב, ובלי שום יכולת לפרוק שכבות ל־CPU או לזיכרון המערכת. המנוע תומך בהגדרה מראש רק ב־1 עד 8 בקשות מקבילות, וכל חלון ההקשר מוגבל על ידי ה־VRAM וסוג ה־KV cache שתבחרו. בנוסף, למרות שהוא יודע לייצר קריאות לכלים, המנוע לא מריץ אותם בעצמו.

שאלות
נפוצות

אפשר להריץ אותו על כרטיס מסך מסדרה 40 או 30?

לא. המנוע והארטיפקט דורשים ארכיטקטורת sm_120a שקיימת ב־RTX 5090, ודורשים CUDA 13.1 ומעלה. חומרה ישנה יותר פשוט לא תטען את הקובץ.

האם אפשר להשתמש בו ישירות בתוך vLLM או ב־Ollama?

לא, הקובץ בנוי אך ורק למנוע NInfer ואינו תואם לשום פורמט סטנדרטי כמו GGUF או Safetensors. כדי לחשוף אותו ליישומים אחרים צריך להריץ את ninfer-serve, שמספק נקודת קצה של HTTP בתקן המקובל.

איך מריצים

אין פה תמיכה בספריות הרגילות. הוא לא יעבוד ב־Transformers, ב־vLLM או ב־Ollama, ואי אפשר לטעון אותו כ־GGUF. הדרישות הן לינוקס 64 ביט, כרטיס מסך NVIDIA GeForce RTX 5090 בלבד, CUDA 13.1 ומעלה, וקומפילציה של NInfer ישירות מקוד המקור מגרסה 5232055 ואילך, כי אין חבילה מוכנה להתקנה.

בפועל מריצים אותו דרך פקודת CLI פשוטה או שרת מקומי שפותח ממשק תואם OpenAI ו־Anthropic. אם אין לכם 5090 במחשב או בשרת, אין מה להוריד את הקובץ, ועדיף לשלם לפי טוקן ל־API של ספק ענן שמחזיק את המודל המקורי.

pip install -U huggingface_hub
hf download neroued/Qwen3.8-27B-NInfer

הקבצים

6 קבצים במאגר, 19.0 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקובץ מופץ תחת רישיון Apache 2.0, שזהה לרישיון של מודל המקור. אפשר להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו במוצרים, כל עוד שומרים על הודעת זכויות היוצרים וכתב הוויתור על האחריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗