GPT
Q

Qwen3.6-27B-GGUF

קוד פתוח

unslothapache-2.02026-04-22

  • transformers
  • gguf
  • unsloth
  • qwen
  • qwen3_5

גרסת קוונטיזציה של מודל מולטימודלי עם 27 מיליארד פרמטרים, שמיועדת למשימות תכנות מורכבות וסוכנים אוטונומיים. הוא כולל חלון הקשר עצום ויכולת מובנית לשימור תהליכי חשיבה.

  • 398 GBמשקל הקבצים
  • 1,251,265הורדות בחודש
  • 955לייקים

מה זה

המודל הזה משלב עיבוד תמונה וטקסט עם 27 מיליארד פרמטרים ומבוסס על שילוב שכבות של Gated DeltaNet וארכיטקטורת תשומת לב מסורתית. ההתמקדות העיקרית כאן היא ביכולות סוכנים וכתיבת קוד, כולל טיפול ישיר בריפוזיטורים שלמים וקריאות לכלים עם מבני נתונים מקוננים. הוא מגיע עם חלון הקשר טבעי של 262,144 טוקנים, וניתן להרחיב אותו עד 1,010,000 טוקנים באמצעות מנגנון YaRN.

אחד החידושים הבולטים הוא מנגנון שימור חשיבה, שמאפשר לשמור את עקבות הנימוק משיחות קודמות כדי למנוע חישובים חוזרים ולשמור על עקביות. בנוסף, המודל אומן בשיטת חיזוי מרובה טוקנים כדי להאיץ את קצב הפליטה בזמן ריצה, ועובד במצב חשיבה מפורט כברירת מחדל.

מתאים ל

  • סוכן תכנות לקוד פתוח

    ניתוח בסיסי קוד גדולים, פתרון באגים ותהליכי עבודה שלמים מול טרמינל בזכות תמיכה מורחבת בהקשר ארוך.

  • הפעלת כלים מקוננים

    פירוק וניתוח של אובייקטים מורכבים בממשקי קריאת פונקציות ואוטומציות הדורשות דיוק במבנה הנתונים.

  • ניתוח וידאו ומסמכים

    עיבוד תמונות וסרטונים ארוכים ברזולוציה מותאמת אישית תוך שמירה על זיכרון עבודה ייעודי.

איפה זה נופל

המודל פועל במצב חשיבה כברירת מחדל, מה שמוביל לפליטת טוקנים ארוכה ואיטית ומחייב הגדרת מגבלת פלט של עד 81,920 טוקנים במשימות מורכבות. שינוי פרמטרים כמו נוכחות כדי למנוע חזרות אינסופיות עלול לגרום לערבוב שפות ולפגיעה בביצועים. בנוסף, הפעלת YaRN לצורך הרחבת הקשר מעבר למגבלה הטבעית פוגעת באיכות התוצאות בטקסטים קצרים.

אותה משפחה

Qwen3.6 יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איך מבטלים את פלט תהליך החשיבה של המודל?

המודל לא תומך במעבר רך דרך פקודות בטקסט. יש להגדיר בפרמטרי הקריאה לשרת את ביטול החשיבה בתבנית השיחה, ולהתאים את הטמפרטורה ל־0.7 כדי לקבל תשובה ישירה.

האם חייבים להקצות שמונה כרטיסי מסך כדי להריץ אותו?

ההמלצה הרשמית להרצה מלאה עם חלון הקשר מלא דורשת שמונה כרטיסים. יחד עם זאת, אפשר לצמצם את חלון ההקשר, להשתמש ב־KTransformers למחשוב משולב מעבד וכרטיס מסך, או לוותר על מודול הראייה כדי לחסוך זיכרון.

איך מריצים

המשקל הכולל של הקבצים במאגר מגיע ל־398 גיגה בייט ב־29 קבצים שונים. כדי להריץ את גרסת המקור במלואה עם חלון הקשר מקסימלי, התיעוד דורש מקביליות של 8 כרטיסי מסך תחת מנועים כמו vLLM או SGLang.

אם אין לכם שרת ייעודי כזה, תוכלו להריץ אותו דרך Unsloth Studio או במסגרת KTransformers שמנצלת חישוב היברידי של מעבד וכרטיס מסך. כאשר משימת העבודה לא דורשת תמונות, כדאי להפעיל את הדגל שמדלג על מקודד הראייה כדי לפנות זיכרון למטמון. אם צריך זמני תגובה מהירים בלי לנהל תשתית כבדה, עדיף לפנות ל־API ייעודי.

ollama run hf.co/unsloth/Qwen3.6-27B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא apache-2.0, שמתיר שימוש מסחרי מלא, שינוי והפצה של הקוד והמשקלים. אתם יכולים לשלב אותו במוצרים פנימיים או חיצוניים בלי לשלם תמלוגים, אך נדרש לשמר את הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗