GPT
Q

Qwen3.6-27B-NVFP4-MTP-GGUF

קוד פתוח

michaelw9999רישיון לא דווח2026-05-25

  • gguf
  • llama.cpp
  • nvfp4
  • mtp
  • qwen3.6

גרסת קוונטיזציה דחוסה של מודל 27B שרצה מהר במיוחד על כרטיסי מסך תומכים. היא מיועדת למי שמחפש ביצועים של מודל בינוני בכרטיס בודד בלי לשלם על API חיצוני.

  • 15.1 GBמשקל הקבצים
  • 340,360הורדות בחודש
  • 61לייקים

מה זה

הקובץ הזה הוא גרסה מכווצת של Qwen3.6-27B בפורמט NVFP4 שכוללת גם MTP לטובת האצת הפלט. מי שיצר אותו השתמש בשיטת התאמת סקייל בשם RSF כדי לדחוס את המשקולות בלי לשבור את המודל, וערבב טנזורים בצורה שונה מגרסאות מוקדמות יותר.

המספרים בדף מראים שההתאמה הזו סגרה 43 אחוז מהפער באיבוד המידע מול מודל הבסיס הלא מכווץ, והביאה מדד פרפלקסיטי של 7.030 לעומת 6.900 במקור. במילים פשוטות, הדיוק קרוב מאוד למודל המקורי למרות הדחיסה האגרסיבית, והיציבות בבחירת הטוקן הראשון מגיעה כמעט ל־92 אחוז.

מתאים ל

  • הסקה מקומית מהירה

    המודל מגיע למהירות גבוהה על כרטיסי מסך תומכים בזכות שימוש בטנזורי MTP דחוסים.

  • שרת עצמאי על כרטיס יחיד

    משקל של כ־15 גיגה־בייט מאפשר לדחוף יכולות של 27B לחומרה ייעודית בלי לחלק משקולות.

  • ניסויי קוונטיזציה מתקדמים

    מתאים לבדיקות השוואתיות של פגיעה באיכות מול שיטות דחיסה ישנות יותר באותו גודל.

איפה זה נופל

הקוונטיזציה הזו לא מושלמת. מדד KLD המקסימלי שנמדד זינק מ־20.67 ל־24.70 בגרסה הנוכחית, מה שאומר שבמקרים קיצוניים המודל עלול לחרוג משמעותית מההתנהגות של מודל המקור ולפלוט תשובות בלתי צפויות. בנוסף, כל המדידות המוצגות מתבססות על מבחן Wikitest בלבד ועל חומרת קצה ספציפית, כך שביצועים בתרחישים מורכבים אחרים עדיין דורשים בדיקה עצמאית לפני הטמעה.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על כרטיס עם 16 גיגה זיכרון?

הקובץ תופס כ־15.27 גיגה־בייט, כך שהוא ימלא כמעט את כל הזיכרון ולא ישאיר מקום לחלון הקשר סביר. למחשבים עם 16GB היוצר מציע לבדוק את גרסת ה־SMALL שהוכנה במיוחד עבורם, גם אם היא איטית יותר.

מה המשמעות של טנזורי MTP שנוספו לגרסה הזו?

טנזורי ה־MTP עברו גם הם המרה ל־NVFP4 כדי לאפשר יצירת טוקנים במקביל. זה מה שמאפשר לו להגיע לקצבים של עשרות טוקנים לשנייה ועד כ־130 טוקנים לשנייה בתנאים מסוימים.

איך מריצים

כדי להריץ את הגרסה הזו צריך כרטיס תומך בפורמט NVFP4. במדידות של היוצר על גבי RTX 5090 עם מבחן Wikitest, הקובץ שוקל 15.27 גיגה־בייט ומייצר קצב של 76.61 טוקנים לשנייה, כשבקונפיגורציות מסוימות היוצר מדווח על הגעה לעד כ־130 טוקנים לשנייה בזכות טנזורי MTP.

אם יש לכם כרטיס עם 16GB זיכרון, הגרסה הזו כנראה תשב צפוף מדי עם ההקשר, ולכן היוצר העלה גרסת SMALL נפרדת שתהיה איטית יותר אך תתאים לזיכרון כזה. אם אין לכם חומרה חדשה מתאימה, עדיף להשתמש ב־API מנוהל במקום להסתבך עם ביצועים נמוכים.

ollama run hf.co/michaelw9999/Qwen3.6-27B-NVFP4-MTP-GGUF:Qwen3.6-27B-NVFP4-MTP-GGUF

הקבצים

3 קבצים במאגר, 15.1 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

היוצר לא דיווח על רישיון בעמוד המודל. מבחינה משפטית, היעדר רישיון מוגדר משאיר את זכויות השימוש בסימן שאלה, ולכן מסוכן מאוד להפיץ אותו כחלק ממוצר מסחרי מבלי לברר תחילה את תנאי הרישיון המקוריים של דגם הבסיס וההרחבות שלו.

הרישיון המלא בעמוד המודל ↗