GPT
Q

Qwen3.6-35B-A3B-AWQ-4bit

קוד פתוח

cyankiwiapache-2.02026-04-16

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • conversational

גרסת קוונטיזציה של 4 ביט למודל תערובת מומחים עם ראייה, שמפעיל 3 מיליארד פרמטרים בלבד בכל שלב ומיועד למשימות קוד וסוכנים אוטונומיים.

  • 36Bפרמטרים
  • 262,144טוקנים בהקשר
  • 23.3 GBמשקל הקבצים
  • 744,575הורדות בחודש

מה זה

מדובר במודל שכולל כמעט 36 מיליארד פרמטרים בסך הכל, אך בזכות ארכיטקטורת תערובת מומחים הוא דורש חישוב של 3 מיליארד בלבד בכל רגע נתון. הדחיסה של cyankiwi מביאה אותו למשקל קבצים של כ־23.3 גיגה בייט בפורמט AWQ, מה שמאפשר להריץ אותו על חומרה מקומית נגישה יחסית. מעבר לטקסט, המודל כולל יכולות עיבוד תמונה מובנות ותומך בחלון הקשר בסיסי של 262,144 טוקנים.

היתרון הבולט בגרסה הזו הוא התמקדות בעבודה כסוכן תכנות. במבחן QwenWebBench הוא מגיע לציון 1397, עוקף בפער ניכר מודלים אחרים בקטגוריית המשקל שלו ומציג יכולת גבוהה באינטראקציה עם כלי פיתוח, דפדפן וממשקי שורת פקודה.

מתאים ל

  • סוכן לפיתוח אתרים

    המודל מוביל במבחן QwenWebBench עם ציון 1397 ומציג יכולת גבוהה בעבודה על קוד צד לקוח.

  • אוטומציה בשורת פקודה

    עם ציון 51.5 ב־Terminal Bench 2.0 הוא מתמודד מצוין עם הפעלת פקודות ואינטראקציה עם סביבת טרמינל.

  • ניתוח מסמכים חזותיים

    רכיב הראייה המובנה לצד חלון הקשר עצום מאפשרים לחלץ מידע מורכב מקבצים משולבי תמונה וטקסט.

איפה זה נופל

למרות השדרוג הכללי, המודל חלש משמעותית במשימות מסוימות בהשוואה לחלופות בגודל דומה. במבחן VITA Bench הוא קיבל ציון של 35.6 בלבד, נמוך בהרבה מגרסאות אחרות כמו Qwen3.5 27B שקיבל 41.8. גם ברשימת השפות הנתמכות מופיעות רק עשר שפות, ועברית אינה חלק מהן, כך שסביר להניח שרמת השליטה שלו בעברית תהיה נמוכה משמעותית מהביצועים באנגלית.

אותה משפחה

Qwen3.6 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל ירוץ בצורה חלקה על כרטיס RTX 4090 יחיד?

המשקלים דורשים סביב 24 גיגה בייט, שזה בדיוק הגבול העליון של הכרטיס. תוכלו להעלות אותו לזיכרון, אך כל שימוש במעבר לטוקנים בודדים יגרום למחסור בזיכרון וידאו עבור זיכרון ההקשר, ולכן עדיף להשתמש בחומרה עם יותר זיכרון.

איך מודל של 36B רץ במהירות של מודל קטן?

בזכות מבנה המומחים, רוב הפרמטרים במודל לא פעילים בזמן יצירת הטקסט. רק 3 מיליארד פרמטרים מופעלים בכל שלב, מה שמאפשר קצב יצירה מהיר תוך שמירה על נפח הידע של מודל גדול.

איך מריצים

כדי להריץ אותו מקומית תצטרכו כרטיס גרפי יחיד עם 32 גיגה בייט זיכרון וידאו, או מערך של שני כרטיסי 16 גיגה בייט, בעיקר אם אתם מתכננים לנצל חלון הקשר ארוך מעבר לשיחה בסיסית. המשקל בזיכרון של המשקלים עצמם תופס סביב 24 גיגה בייט, כך שכרטיס של 24 גיגה בייט סטנדרטי יהיה גבולי מאוד ברגע שזיכרון ההקשר יתחיל להתמלא.

הקבצים נתמכים ישירות בספריות כמו vLLM או SGLang. אם אין לכם כרטיס מקומי מתאים, או שאתם לא רוצים לשלם על שרת ייעודי בענן רק כדי לבדוק אותו, שימוש בממשקי API של ספקי ענן יחסוך את עלויות החומרה וההקמה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="cyankiwi/Qwen3.6-35B-A3B-AWQ-4bit")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי מלא, שינוי של המשקלים, הפצה ושילוב במוצרים סגורים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקוד או במוצר שלכם, ללא תמלוגים או הגבלות שימוש נוספות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗