GPT
Q

Qwen3.5-122B-A10B-AWQ-4bit

קוד פתוח

cyankiwiapache-2.02026-02-25

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • conversational

גרסת קוונטיזציה של 4 ביט למודל תערובת מומחים, שמשלבת קלט תמונה וטקסט עם חלון הקשר ארוך. הוא מפעיל רק עשרה מיליארד פרמטרים בכל טוקן וחוסך משאבי ריצה.

  • 24Bפרמטרים
  • 262,144טוקנים בהקשר
  • 74.6 GBמשקל הקבצים
  • 25,818הורדות בחודש

מה זה

מדובר במודל משולב לטקסט ותמונה שמבוסס על ארכיטקטורת תערובת מומחים עם מאתיים חמישים ושישה מומחים, שמתוכם פועלים רק שמונה מנותבים ואחד משותף בכל צעד. המבנה ההיברידי משלב שכבות ליניאריות מסוג דלתא נט לצד שכבות קשב רגילות, מה שנועד לאפשר הסקת מסקנות מהירה וזולה יותר בלי לאבד עומק חישובי.

במבחני הביצועים הוא מציג יכולות מרשימות מאוד ביחס למודלים בקטגוריה שלו. במבחן תכנות סוור בנץ' מאומת הוא מגיע לציון שבעים ושניים, ובמבחן הפעלת כלים וסוכנים בי אף סי אל גרסה ארבע הוא רושם שבעים ושניים נקודה שתיים, תוצאה גבוהה משמעותית ממודלים מתחרים באותו סדר גודל. התוצאות האלה מראות שמנגנון ניתוב המומחים המצומצם מצליח לשמור על כושר ניתוח גבוה במשימות קוד ומעקב אחרי הוראות מורכבות.

מתאים ל

  • בניית סוכני תוכנה ואוטומציה

    התוצאה הגבוהה במבחן בי אף סי אל הופכת אותו למתאים לקריאות לפונקציות והפעלת סביבות טרמינל.

  • ניתוח מסמכים חזותיים ארוכים

    השילוב בין קלט תמונה לחלון הקשר של מאתיים שישים ושניים אלף טוקנים מאפשר לקרוא קבצים כבדים.

  • פתרון באגים במאגרי קוד

    ציון של שבעים ושניים אחוזים בסוור בנץ' מספק דיוק מספק לזיהוי ותיקון תקלות בקוד קיים.

איפה זה נופל

למרות החוזק בקוד, במבחני תכנון עמוק ובעיות חשיבה מורכבות המודל מקבל ציונים נמוכים למדי, כמו עשרים וארבע נקודה אחת בדיפ פלאנינג ועשרים וחמש נקודה שלוש במבחן חשיבה עם שרשרת מחשבה. בנוסף, בגלל שמדובר בגרסת קוונטיזציה של ארבע ביט, עלולה להיות ירידה מסוימת בדיוק לעומת משקלי המקור המלאים.

אותה משפחה

Qwen3.5 יצא ב־5 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

כמה זיכרון וידאו צריך בפועל כדי להריץ את המודל הזה?

המשקלים עצמם שוקלים קרוב לחמישים ושבעים גיגה בייט, כך שצריך כרטיס עם שמונים גיגה בייט זיכרון וידאו לכל הפחות. אם תרצו לנצל את מלוא חלון ההקשר הארוך, תצטרכו זיכרון נוסף עבור מטמון הטוקנים.

איך המודל שומר על מהירות גבוהה עם כל כך הרבה פרמטרים?

למרות שיש לו כמאה עשרים ושניים מיליארד פרמטרים בסך הכל, ארכיטקטורת המומחים מפעילה רק עשרה מיליארד פרמטרים עבור כל טוקן שנוצר. החישוב בפועל קל בהרבה ומאפשר זמני תגובה מהירים יותר.

איך מריצים

כדי להריץ את המודל הזה תצטרכו נפח זיכרון וידאו של כשמונים גיגה בייט לפחות, מה שאומר כרטיס איי מאה או אייג' מאה בודד, או מערך של כמה כרטיסים קטנים יותר. המשקל של הקבצים עומד על כמעט שבעים וחמישה גיגה בייט, ובזכות הקוונטיזציה של ארבע ביט אפשר להריץ אותו בכלים כמו וי אל אל אם, אס ג'י לאנג או קיי טרנספורמרס.

אם אתם לא מחזיקים שרת ייעודי וצריכים רק קריאות בודדות פה ושם, כנראה שעדיף לשלם לפי שימוש לספק שמציע גישה למודל במקום לשכור חומרה יקרה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="cyankiwi/Qwen3.5-122B-A10B-AWQ-4bit")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון אפאצ'י שתיים אפס. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים, והפצה של מוצרים שמבוססים עליו, בתנאי שאתם שומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗