GPT
Q

Qwen_Qwen3.6-27B-GGUF

קוד פתוח

bartowskiapache-2.02026-04-22

  • gguf
  • image-text-to-text
  • endpoints_compatible
  • imatrix
  • conversational

גרסת GGUF מכווצת למודל מולטימודלי של 27 מיליארד פרמטרים. היא מיועדת למי שרוצה לשלב עיבוד תמונה וטקסט מקומית בלי לתחזק שרת ענק.

  • 457 GBמשקל הקבצים
  • 87,777הורדות בחודש
  • 85לייקים

מה זה

מדובר בהמרה של המודל Qwen3.6-27B לפורמט GGUF באמצעות llama.cpp, כשהמטרה המרכזית היא משימות תמונה וטקסט. בניגוד למודלי שפה רגילים שמתמקדים רק במלל, הוא בנוי לנתח קלטים חזותיים לצד שאלות טקסטואליות. bartowski ביצע את כל הכיווצים כאן עם imatrix, מה שאומר שחישובי הדיוק התבססו על מערך נתונים ייעודי כדי לצמצם עיוותים בתשובות בזמן דחיסת המשקלים.

התוספת הבולטת בגרסה הזו היא תמיכה בשכבות MTP לטובת speculative decoding ב־llama.cpp. המנגנון הזה מאפשר האצה מורגשת בקצב פליטת הטוקנים אם מפעילים את הדגל המתאים, תכונה שלא תמיד קיימת בהמרות מקבילות בגודל כזה. בנוסף, קיימים כאן כיולים מיוחדים שמשאירים את שכבות הפלט וההטמעה ב־Q8 בזמן ששאר הרשת נדחסת, כדי לשמור על יציבות התחביר גם ברמות דחיסה אגרסיביות יחסית.

מתאים ל

  • ניתוח מסמכים ותמונות

    הוא מטפל בקלטי תמונה וטקסט מקומית בלי לשלוח מידע רגיש לענן חיצוני.

  • הסקה מהירה בחומרה פרטית

    תמיכת MTP מאפשרת האצה של ייצור הטקסט בכרטיסי 24 ג'יגה ביתיים.

  • הטמעה בתוכנות שולחניות

    קבצי GGUF נטענים בקלות ישירות לתוך LM Studio ו־llama.cpp.

איפה זה נופל

הקובץ המקורי מחולק לעשרות גרסאות דחיסה שונות, וכשמגיעים לאזורי ה־IQ2 וה־Q2 איכות הפלט והבנת התמונה נפגעות בצורה חדה מאוד. מעבר לזה, הכרטיס מציין במפורש שאם המודל נתמך רק לאחרונה בספרייה, ייתכן שתצטרכו להמתין לעדכונים נוספים מהמפתחים כדי שהוא יעבוד יציב בכל הכלים. כדאי לבדוק היטב את תמיכת העברית והפענוח של טקסטים מורכבים מתוך תמונות לפני שמסתמכים עליו בפרודקשן.

אותה משפחה

Qwen-Qwen3.6 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ כדאי להוריד מתוך הרשימה הארוכה?

עבור רוב השימושים, קובץ Q4_K_M ששוקל 17.98 ג'יגה הוא נקודת הפתיחה המאוזנת ביותר בין דיוק לנפח. אם יש לכם מספיק זיכרון בכרטיס המסך, קבצי Q5_K_M או Q6_K יתנו איכות קרובה למקור, בעוד שדחיסות IQ מומלצות רק כשחייבים לדחוס מתחת ל־16 ג'יגה.

איך מפעילים את מנגנון ההאצה החדש?

בזמן הפעלת llama.cpp מעבירים את הדגל spec-type draft-mtp בשורת הפקודה. תכונה זו נתמכת מגרסה b9180 והלאה ומנצלת את שכבות ה־MTP המובנות כדי לזרז את יצירת הפלט.

איך מריצים

כדי להריץ אותו בנוחות תצטרכו להתאים את הקובץ לזיכרון הווידאו. גרסאות ברירת המחדל כמו Q4_K_M שוקלות כמעט 18 ג'יגה, ולכן כרטיס בודד של 24 ג'יגה יחזיק אותן במלואן יחד עם הקשר עבודה בסיסי. קובצי ה־BF16 המלאים מגיעים ל־54 ג'יגה ומחייבים פיצול בין כרטיסים או שילוב של זיכרון מערכת איטי יותר. אפשר לטעון את הקבצים ישירות לתוך LM Studio, Jan AI, ramalama או שורת הפקודה של llama.cpp עם הדגל spec-type draft-mtp.

אם אין לכם חומרה עם לפחות 24 ג'יגה זיכרון גרפי ייעודי, או שאתם בונים שירות שצריך לעמוד בעומס של משתמשים במקביל, שווה לשקול פנייה ל־API מנוהל. הרצה מקומית על מעבד רגיל או תחת חיתוך אגרסיבי לשלושה ביטים תגרור זמני תגובה ארוכים במיוחד, בעיקר כשמזינים תמונות כבדות שדורשות עיבוד מוקדם.

ollama run hf.co/bartowski/Qwen_Qwen3.6-27B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקבצים והפצה שלהם כחלק ממוצר עצמאי. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗