GPT
Q

Qwen3.6-27B-AWQ-INT4

קוד פתוח

cyankiwiapache-2.02026-04-22

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • conversational

גרסת קוונטיזציה AWQ ב־4 ביט למודל קוד וסוכנים עם ראייה מובנית. מיועד למי שרוצה ביצועים כמעט של מודל ענק על כרטיס בודד.

  • 29Bפרמטרים
  • 262,144טוקנים בהקשר
  • 19.1 GBמשקל הקבצים
  • 1,276,965הורדות בחודש

מה זה

מדובר בהמרה של דגם 27B שכויל ב־AWQ על משימות סוכנים ומדעים מדויקים. המבנה שלו כולל שילוב של שכבות Gated DeltaNet ותשומת לב רגילה עם אנקודר ראייה, מה שמאפשר לו לנתח תמונות לצד טקסט. המאפיין הבולט בדור הזה הוא שמירת רצף המחשבה מהיסטוריית השיחה כדי לא לאבד כיוון בעבודה איטרטיבית.

במבחני סוכני תכנות כמו SWE-bench Verified הוא מקבל 77.2, תוצאה שעוקפת את קודמו ומתקרבת למודלי ענק. ב־LiveCodeBench v6 הוא עומד על 83.9 ובמבחן המתמטיקה AIME26 הגיע ל־94.1. המשמעות היא יכולת גבוהה מאוד בכתיבת קוד, ניפוי שגיאות ופתרון בעיות לוגיות מורכבות.

מתאים ל

  • סוכן תכנות לפרויקטים

    ציון 77.2 ב־SWE-bench מראה יכולת אמיתית לקרוא מאגרי קוד, לתקן באגים ולבצע שינויים מורכבים.

  • פיתוח ממשקי משתמש

    ניתוח תמונות לצד תוצאה של 1487 ב־QwenWebBench הופכים אותו ליעיל בהמרת עיצובים לקוד אתרים.

  • הרצה מקומית על כרטיס יחיד

    משקל של 19.1 גיגה בייט נכנס לתוך כרטיס 24GB בודד וחוסך עלויות ענן בפיתוח פנימי.

איפה זה נופל

הכיול נעשה עבור אנגלית, סינית, הינדי, ערבית, רוסית, יפנית, קוריאנית, הולנדית, צרפתית וספרדית. עברית אינה מופיעה ברשימת השפות שכוילו, מה שאומר שדיוק הקוונטיזציה בעברית לא נבדק ועלול להוביל לפליטת שגיאות.

בנוסף, במבחן HLE המודל משיג רק 24.0, וב־SWE-bench Pro הוא נופל ל־53.5. במשימות תוכנה סבוכות מאוד בעולם האמיתי הוא עדיין מתקשה, וקוונטיזציה של 4 ביט עלולה לייצר אי־דיוקים קטנים בקוד רגיש.

אותה משפחה

Qwen3.6 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

הוא עשוי להבין עברית באופן בסיסי, אך עברית אינה מופיעה ברשימת השפות ששימשו לכיול הקוונטיזציה. יש סיכון מוגבר להזיות ולשיבושים תחביריים בעברית לעומת אנגלית.

האם אפשר להשתמש בכל חלון ההקשר על כרטיס של 24GB?

לא. משקל המודל לבדו תופס מעל 19 גיגה בייט, כך שנותר מעט מאוד זיכרון ל־KV cache. ניצול של 262,144 טוקנים ידרוש כרטיס נוסף או פתרונות אופטימיזציה אגרסיביים.

איך מריצים

המשקל הכולל של הקבצים עומד על 19.1 גיגה בייט, כך שהוא דורש כרטיס מסך יחיד של 24 גיגה בייט כמו RTX 3090, RTX 4090 או כרטיס שרת מקביל. הרצה ישירה ב־transformers, vLLM או SGLang תעבוד חלק, אך אם תנצלו את חלון ההקשר המלא של 262,144 טוקנים, זיכרון ה־VRAM ייגמר מהר מאוד ותצטרכו חומרה נוספת עבור ה־KV cache.

אם אתם זקוקים לחלון הקשר עמוק במיוחד בייצור או שאין לכם שרת ייעודי זמין, קריאה ל־API תהיה זולה ופשוטה יותר מניהול התשתית לבד.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="cyankiwi/Qwen3.6-27B-AWQ-INT4")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים מפורסמים תחת רישיון apache-2.0. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו ולהפיץ אותו במוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗