GPT
T

ThinkingCap-Qwen3.6-27B-MTP-GGUF

קוד פתוח

protoLabsAIapache-2.02026-07-07

  • gguf
  • nvfp4
  • mtp
  • speculative-decoding
  • blackwell

גרסת GGUF למודל חשיבה בגודל 27B שחותך כמעט חצי מטוקני הניתוח המיותרים. הוא כולל ראש ניבוי מובנה ומיועד בעיקר למי שרוצה ביצועים מהירים על חומרת בלקוול או כרטיסי 16GB ומעלה.

  • 193 GBמשקל הקבצים
  • 3,635הורדות בחודש
  • 65לייקים

מה זה

מדובר בהתאמה של Qwen3.6-27B שעברה כוונון ייעודי לקיצור תהליך המחשבה של המודל. במקום להאריך בדברים בתוך בלוק החשיבה, הוא מגיע ישירות לפתרון וחוסך בממוצע כארבעים אחוז מטוקני המחשבה, עם ממוצע של 675 טוקנים לעומת 1401 בבסיס.

הייחוד של החבילה הזו הוא שילוב של ראש MTP בתוך הקובץ עצמו, מה שנותן פענוח משוער בלי צורך להגדיר מודל טיוטה נפרד. בנוסף יש כאן גרסאות NVFP4 מותאמות לארכיטקטורת בלקוול לצד מדרגות כיול רגילות, כך שאפשר להריץ מודל 27B אינטליגנטי בקבצים שנעים בין 10 ל־55 ג'יגה.

בבדיקות של היוצרים המודל מציג דיוק של 94 אחוז בקריאות לפונקציות ו־93 אחוז ברגישות קוונטיזציה, כך שהדחיסה לא פגעה במבנה התשובות שלו. שיעור הקבלה של ניבויי ה־MTP נע בין 62 ל־91 אחוז, מה שמקצר משמעותית את זמן ההמתנה לפלט.

מתאים ל

  • הפעלת כלים וקריאות פונקציה

    הוא שומר על 94 אחוזי דיוק בשימוש בכלים ומגיב מהר בלי לבזבז זמן על נימוקים מיותרים.

  • שרת מקומי מבוסס בלקוול

    גרסת NVFP4 מנצלת את ליבות הטנזור של סדרת RTX 50 להאצה מקסימלית בלי לנהל שני מודלים.

  • מערכות חשיבה על חומרת 16GB

    קובץ IQ3_M נכנס במלואו לזיכרון של כרטיס בודד ועדיין מספק יכולות היסק של מודל 27B.

איפה זה נופל

הנפילה הכי כואבת של המודל מגיעה כשמנסים להריץ אותו עם דגימה חמדנית, כלומר בטמפרטורה 0. במצב כזה הוא נכנס ללולאות אינסופיות ולא סוגר את תגית המחשבה לעולם, ולכן חובה לקבע טמפרטורה של 0.6 עם ערכי top_p ו־top_k מוגדרים. בנוסף, במבחני תכנות קשים ואדברסריים הוא עומד על 50 אחוז בלבד, מה שמראה שגודל 27B עדיין מוגבל במשימות קוד מורכבות במיוחד. נתוני הביצועים של NVFP4 נבדקו בינתיים על מעבד בלבד, כך שמהירות הריצה שלו על גבי CUDA ב־llama.cpp טרם אומתה במלואה.

שאלות
נפוצות

למה המודל חוזר על עצמו ולא מפסיק לפלוט טקסט?

זה קורה כמעט תמיד בגלל הרצה בטמפרטורה 0. מודל החשיבה הזה חייב דגימה בהתאם להוראות היוצרים, עם טמפרטורה 0.6, top_p של 0.95 ו־top_k של 20 כדי לדעת מתי לסיים את החשיבה ולעבור לתשובה.

האם צריך להוריד את הקובץ שנמצא בתיקיית mtp-head?

לא, הקובץ בתיקייה הזו הוא ראש ניבוי נפרד שמיועד לחיבור ידני למודלים חיצוניים וטעינה שלו לבד תפיל את השרת. כל קובצי ה־GGUF הראשיים במאגר כבר מכילים את ראש ה־MTP בתוכם באופן מובנה.

האם גרסת NVFP4 תעבוד על כרטיסי מסך מדור קודם כמו RTX 3090 או 4090?

היא מיועדת ספציפית לליבות הטנזור של ארכיטקטורת Blackwell כמו סדרת RTX 50. על כרטיסים ישנים יותר עדיף לבחור בגרסאות הסטנדרטיות כמו Q4_K_M או Q5_K_M שרצות בצורה יציבה ומוכחת.

איך מריצים

כדי להריץ אותו כמו שצריך ב־llama.cpp חייבים גרסה עדכנית שתומכת בדגל spec-type draft-mtp, או אולמה 0.31 ומעלה. מי שמחזיק כרטיסי סדרה 5000 או PRO 6000 של אנבידיה יבחר בגרסת NVFP4 ששוקלת 18.2 ג'יגה. לכרטיסי 24 ג'יגה רגילים או סביבות צפופות יותר יתאימו קובצי Q4_K_M או IQ3_M שנכנסים אפילו לכרטיסי 16 ג'יגה.

אם אתם מריצים ב־vLLM עם NVFP4, חובה להשתמש במנוע marlin, כי קרנלים אחרים נתקעים בגלל המבנה ההיברידי של הרשת. במקרים שאין ברשותכם כרטיס עם לפחות 16 ג'יגה זיכרון גרפי פנוי, או אם אין לכם סבלנות להגדרות ספציפיות של קרנלים ודגלי קונפיגורציה, עדיף לפנות ל־API חיצוני.

ollama run hf.co/protoLabsAI/ThinkingCap-Qwen3.6-27B-MTP-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש במודל לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים סגורים בלי לשלם תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗