GPT
Q

Qwen3.5-122B-A10B-int4-AutoRound

קוד פתוח

Intelרישיון לא דווח2026-02-27

  • safetensors
  • qwen3_5_moe
  • 4-bit
  • auto-round

גרסת קוונטיזציה של מודל מומחים מבית עליבאבא שאינטל דחסה לרמת ארבעה ביט. היא מאפשרת להריץ מודל ענק עם כעשרה מיליארד פרמטרים פעילים על חומרה מקומית נגישה יותר.

  • 20Bפרמטרים
  • 262,144טוקנים בהקשר
  • 71.5 GBמשקל הקבצים
  • 203,093הורדות בחודש

מה זה

אינטל לקחה את מודל המומחים של עליבאבא ודחסה אותו לרמת int4 עם group_size 128 באמצעות כלי הAutoRound שלה. המבנה שלו מבוסס תערובת מומחים, כך שלמרות המשקל הכולל רק כעשרה מיליארד פרמטרים פעילים בכל מעבר. לפי הדוגמאות הרשמיות הוא כולל מעבד תמונה מובנה שיודע לקבל קלטי תמונה וטקסט יחד, לצד חלון הקשר עצום של 262,144 טוקנים שמיועד למסמכים ארוכים במיוחד.

ההבדל המשמעותי לעומת המקור הוא הדחיסה. במקום להחזיק משקלים בנפח מלא, הקבצים מכווצים לנפח כולל של 71.5 גיגה בייט. אינטל מציעה כאן שתי גרסאות, גרסה שעברה כוונון עדין של הקוונטיזציה וגרסת RTN בסיסית יותר, אך מציינת בפירוש שגרסת הכוונון לא עברה בדיקות אימות ספציפיות על המודל הזה.

מתאים ל

  • ניתוח תמונות וטקסט

    ארכיטקטורת המודל כוללת רכיב מעבד תמונה מובנה שמקבל תמונות לצד שאלות טקסטואליות.

  • עיבוד מסמכים ארוכים

    חלון הקשר של 262,144 טוקנים מאפשר להזין טקסטים גדולים בלי לחתוך אותם מראש.

  • שרת היסק מקומי

    הקוד כולל תמיכה בהרצה מקומית מעל vLLM בתצורת שרת עצמאי.

איפה זה נופל

הכרטיס מודה במפורש שהדחיסה המכווננת לא נבדקה ולא אומתה על המודל הזה ספציפית. מעבר לזה, המודל עלול לפלוט עובדות שגויות, תוכן פוגעני או מוטה, והיוצרים מזהירים לא להסתמך עליו למטרות שדורשות דיוק עובדתי. בנוסף, ההרצה דורשת התקנות ישירות ממאגרי פיתוח של vLLM ושל Hugging Face, יחד עם Pull Request ייעודי מספר 1476 של AutoRound, כך שההטמעה אינה יציבה לחלוטין מחוץ לקופסה.

שאלות
נפוצות

איזו גרסה של המודל מומלץ להוריד לפי אינטל?

הענף הראשי מכיל את הגרסה שעברה כוונון עדין של הקוונטיזציה, ובדרך כלל היא העדיפה. עם זאת, אינטל מצהירה בגלוי שהיא לא אימתה ובדקה את הגרסה הזו על המודל הספציפי, כך שכדאי לבחון גם את גרסת RTN שנמצאת בגרסת השינוי 3f4ba63.

האם אפשר להריץ אותו ישירות עם ספריות פייתון רגילות?

לא מיד. נדרשת ספריית transformers בגרסה 5.2.0 לפחות, התקנה מענפי הפיתוח הראשיים של vLLM, והטמעה של Pull Request שמספרו 1476 בפרויקט AutoRound.

איך מריצים

כדי להריץ אותו בפועל צריך כרטיסי מסך שמסוגלים להחזיק לפחות 71.5 גיגה בייט של משקלים בזיכרון, עוד לפני שמחשבים את זיכרון ההקשר. אינטל מספקת דוגמת הרצה דרך vLLM עם tensor-parallel-size 1 ופרסר תמיכה בחשיבה, או ישירות דרך ספריית transformers מגרסה 5.2.0 ומעלה.

אם אין לכם מערך שרתים מקומי עם מספיק זיכרון וידאו שמחזיק את כל הנפח הזה ביציבות, פנייה לפתרון ענן מנוהל או API חיצוני תהיה זולה ופשוטה בהרבה מהתעסקות בתלויות הקוד הנדרשות.

pip install -U huggingface_hub
hf download Intel/Qwen3.5-122B-A10B-int4-AutoRound

הרישיון

הרישיון של המודל לא דווח בעמוד שלו. אינטל מפנה לבדוק את תנאי הרישיון של המקור של עליבאבא, וממליצה במפורש להתייעץ עם עורך דין לפני שימוש מסחרי. כל עוד תנאי המקור לא נבדקו ואין רישיון רשמי מוצהר בהפצה הזו, הכנסה שלו למוצר מסחרי כרוכה בסיכון משפטי ברור.

הרישיון המלא בעמוד המודל ↗