GPT
T

ThinkingCap-Qwen3.6-27B-int4-AutoRound-v1

קוד פתוח

josefprusaרישיון לא דווח2026-07-06

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • auto-round

גרסת קוונטיזציה של מודל חשיבה שנועדה להידחס לכרטיס מסך ביתי חזק בלי לאבד מהירות. היא מיועדת למי שרוצה להריץ סוכנים עצמאיים עם חלון הקשר ארוך ולא רוצה לשלם על שרתי ענן יקרים.

  • 6.3Bפרמטרים
  • 262,144טוקנים בהקשר
  • 19.0 GBמשקל הקבצים
  • 2,509הורדות בחודש

מה זה

מדובר בהמרה של המודל ThinkingCap ממשפחת Qwen3.6 לדיוק INT4 באמצעות AutoRound, כשהטנסורים של מנגנון החיזוי נשמרו ב־BF16 כדי לאפשר פענוח ספקולטיבי מהיר. המטרה של המודל המקורי היא לשמור על יכולות ההסקה של מודלי חשיבה, אבל עם פחות טוקנים מבוזבזים על תהליך המחשבה עצמו.

התוצאות במבחני הסוכנים המקומיים מראות ציון כולל של 81, כאשר הוא חזק במיוחד בשליפת זיכרון עם ציון 93, ובקריאות לכלים עם 90. לעומת זאת, המבחנים מראים נפילה ברורה ביכולות של שורת פקודה עם ציון 65 ובמציאת באגים עם 73. הוא מצטיין בהבנת הוראות ומעקב אחריהן, אבל אם תתנו לו לכתוב סקריפטים מסובכים למסוף, הוא נוטה לפספס.

מתאים ל

  • סוכנים עם חלון הקשר ארוך

    שליפת זיכרון גבוהה במבחנים ותמיכה בהקשר רחב מאפשרות מעקב יעיל אחרי היסטוריית שיחה ארוכה.

  • הפעלת כלים ו־API

    ציון 90 בבדיקות קריאה לכלים מראה שהוא מטפל טוב בפורמטים מובנים ובהפעלת פונקציות חיצוניות.

  • שרת מקומי לפניות קצרות

    קצב של מאות טוקנים בשנייה תחת עומס קל ב־vLLM בזכות מנגנון פענוח ספקולטיבי שמאיץ יצירת טקסט.

איפה זה נופל

הקוונטיזציה כאן נעשתה בתצורת group size 128 שמעדיפה מהירות וחיסכון במקום על פני דיוק מרבי, מה שאומר שיש פגיעה באיכות בהשוואה למודל המקורי. במבחני הסוכנים הוא נכשל בחמישה מתוך עשרים תרחישים, כולל אזהרות ספק בשני מקרים נוספים. הביצועים במשימות קוד ומסוף נמוכים משמעותית משאר היכולות, כך שלא כדאי לבנות עליו לפיתוח תוכנה אוטומטי בלי בדיקה מעמיקה.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס עם 24GB זיכרון?

המשקל של הקבצים עצמם הוא סביב 19GB, כך שעל הנייר המודל נכנס. הבעיה מתחילה בהקשר ארוך שדורש זיכרון נוסף ל־KV cache, ולכן כרטיס כזה יגביל אתכם לחלון קצר מאוד או ידרוש פשרות כבדות.

האם המודל תומך בחשיבה מובנית?

כן, המודל שומר על התנהגות החשיבה של Qwen3.6 ומוגדר מראש לעבוד עם תבנית צ'אט שמאפשרת חשיבה. היתרון שלו הוא שימוש בפחות טוקנים של מחשבה בהשוואה למודלים דומים.

איך מריצים

כדי להריץ אותו צריך כרטיס מסך עם 32GB זיכרון, כמו RTX 5090 שעליו נבדק, ועבודה עם vLLM בגרסה 0.24.0 ומעלה. כדי לנצל את חלון ההקשר המלא תהיו חייבים לכווץ גם את ה־KV cache ל־4 ביט, אחרת הזיכרון ייגמר כמעט מיד.

ההרצה המקומית הגיונית רק אם יש לכם את החומרה המתאימה ואתם צריכים פרטיות או תעבורה רציפה. אם אתם צריכים רק שאילתות בודדות או שאין לכם כרטיס עם מספיק זיכרון, פנייה ל־API מנוהל תהיה זולה ופשוטה בהרבה מהתעסקות בהגדרות השרת.

from transformers import pipeline

pipe = pipeline("text-generation", model="josefprusa/ThinkingCap-Qwen3.6-27B-int4-AutoRound-v1")
print(pipe("שלום"))

הרישיון

הרישיון של המודל לא דווח במאגר. במצב כזה אסור להניח שמותר להשתמש בו במוצר מסחרי, ועדיף לבדוק קודם את תנאי הרישיון של מודל המקור ThinkingCap מבית BottleCap AI לפני שמפיצים אותו ללקוחות.

הרישיון המלא בעמוד המודל ↗