GPT
Q

Qwen_Qwen3.6-35B-A3B-GGUF

קוד פתוח

bartowskiapache-2.02026-04-16

  • gguf
  • image-text-to-text
  • endpoints_compatible
  • imatrix
  • conversational

גרסת קוונטיזציה של מודל מולטימודלי 35B שמיועדת לעיבוד משולב של תמונה וטקסט. הוא נותן פתרון מקומי חזק למי שמחזיק כרטיס מסך של 24GB ורוצה ביצועי ראייה בלי להוציא נתונים לענן.

  • 567 GBמשקל הקבצים
  • 333,549הורדות בחודש
  • 152לייקים

מה זה

מדובר בהמרה של המודל Qwen3.6-35B-A3B לפורמט GGUF באמצעות llama.cpp, שמתאימה להרצה על מעבדים וכרטיסי מסך ביתיים. המודל מתמחה במשימות של תמונה וטקסט יחד ומפיק פלט טקסטואלי, כשבמבנה הפרומפט מובנה תג חשיבה ייעודי שמאפשר לו לתכנן את התשובה לפני הפקת הפלט.

בגרסה הזו נוספה תמיכה בשכבות MTP דרך דגל הרצה ייעודי, שמאיץ את ייצור הטוקנים. כל הקבצים כוילו באמצעות imatrix כדי למזער את איבוד הדיוק בדחיסה, וההפצה כוללת גם גרסאות שבהן שכבות הקלט והפלט נשמרות ברמת דיוק גבוהה של שמונה ביטים כדי לשמור על יציבות התוצאה.

מתאים ל

  • ניתוח מסמכים ותמונות

    קריאת טקסט וניתוח אלמנטים מתוך צילומי מסך או קבצים חזותיים ישירות על המחשב המקומי.

  • שילוב בתוכנות צד לקוח

    הרצה מקומית דרך LM Studio או Jan AI בלי לשלוח שום מידע ויזואלי לרשת.

  • בניית עוזרי קוד ומחקר

    עיבוד שאילתות מורכבות תוך שימוש במנגנון החשיבה המובנה שמשפר את תכנון התשובות.

איפה זה נופל

אם אתם מוגבלים בזיכרון, התרחקו מגרסאות כמו IQ1_M שמוגדרת כבעלת איכות נמוכה ביותר ולא מומלצת לשימוש שוטף. מעבר לזה, המודל משתמש בפורמט פרומפט קשיח עם תגיות מערכת ובלוק חשיבה, ואם לא תקפידו על המבנה המדויק תקבלו פלט מקוטע או חזרתי.

אותה משפחה

Qwen-Qwen3.6 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד למחשב ביתי חזק?

למי שמחזיק כרטיס מסך מודרני של 24GB, קובץ Q4_K_M בגודל 22.29GB נותן את האיזון הטוב ביותר בין איכות לנפח. הוא נכנס במלואו לכרטיס ומשאיר מעט מקום לשכבות עבודה בלי ליפול לראם.

איך מפעילים את שכבות ה־MTP החדשות?

צריך לוודא שמשתמשים בבילד עדכני של llama.cpp מגרסה b9180 ומעלה. בהרצה מוסיפים את הדגל הייעודי draft-mtp שמפעיל את התמיכה במנגנון החדש.

איך מריצים

בשביל להריץ אותו בקצב סביר, קובץ הדיפולט המומלץ Q4_K_M שוקל 22.29GB ודורש כרטיס עם לפחות 24GB זיכרון ייעודי כדי להיכנס כולו לכרטיס המסך. אם אתם יורדים מתחת לארבעה ביטים, עדיף לבחור בגרסאות ה־IQ שמספקות איכות סבירה יותר ביחס לגודל, בעוד גרסאות רגילות כמו Q3_K_S יפגעו בדיוק באופן מורגש.

המערך עובד ישירות מול כלי שולחן עבודה כמו LM Studio או הרצה מקומית ב־llama.cpp. אם אין לכם חומרה ייעודית עם מספיק זיכרון וידאו, פיצול הזיכרון לראם של המעבד יאט את העיבוד בצורה חדה, ובמקרה כזה עדיף לקרוא למודל דרך ספק צד שלישי.

ollama run hf.co/bartowski/Qwen_Qwen3.6-35B-A3B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

36 קבצים במאגר, 567 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי קוד והפצה חופשית. אתם יכולים לשלב אותו בתוך תוכנה קניינית או שירות בתשלום, בתנאי שאתם שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗