GPT
Q

Intel/Qwen3.6-27B-int4-AutoRound

קוד פתוח

Intelapache-2.02026-04-24

  • safetensors
  • qwen3_5
  • 4-bit
  • auto-round

גרסת 4 ביט מכווצת של קוון שנוצרה עם כלי האופטימיזציה של אינטל. היא מיועדת למי שרוצה להריץ מודל חזק על כרטיס בודד בלי לשלם על כל טוקן לענן.

  • 6.3Bפרמטרים
  • 262,144טוקנים בהקשר
  • 17.7 GBמשקל הקבצים
  • 45,670הורדות בחודש

מה זה

אינטל לקחו את Qwen3.6 בגרסת 27B ודחסו אותו לדיוק של int4 עם group size של 128 באמצעות כלי ה־AutoRound שלהם. המבנה הפנימי מבוסס על הארכיטקטורה של Qwen3_5ForConditionalGeneration עם 6,284,446,960 פרמטרים פעילים, כשהמשקל הכולל יושב על 17.7 גיגה בייט שמחולקים לעשרים ושניים קבצים. המטרה פה היא לשמור על יכולות ההסקה וההבנה של המודל המקורי, אבל במשקל שמאפשר לטעון אותו לתוך זיכרון של כרטיס גרפי צנוע בהרבה.

חלון ההקשר מגיע ל־262,144 טוקנים, מה שעל הנייר נותן לכם לזרוק פנימה מסמכים ארוכים מאוד. כרטיס המודל מציג דוגמת הפעלה ישירה ב־vllm עם תמיכה ב־speculative decoding מסוג qwen3_next_mtp, מה שמיועד לקצר זמני תגובה בזמן יצירת טקסט. אין כאן טבלאות מבחנים שמראות כמה דיוק אבד ביחס למקור, כך שאת טיב הפלט תצטרכו לבדוק בעצמכם מול משימות המטרה שלכם.

מתאים ל

  • שרת צ'אט עצמאי בארגון

    מאפשר להרים שירות שיחה פנימי על גבי כרטיס מסך יחיד של 24 גיגה בלי להוציא מידע רגיש החוצה לענן.

  • עיבוד טקסטים ארוכים

    מתאים לניתוח ותמצות של קבצים ומסמכים כבדים בזכות תמיכה תאורטית בחלון של עד 262,144 טוקנים.

  • מערכות הסקה מהירות

    תומך ב־speculative decoding מובנה דרך vLLM, מה שמאפשר לייצר טוקנים בקצב גבוה במיוחד בחומרה מקומית.

איפה זה נופל

אינטל מציינים במפורש שהמודל מייצר שגיאות עובדתיות ואסור להסתמך עליו כמקור מידע מדויק. בגלל אופי הנתונים שעליהם אומן מודל הבסיס, הוא עלול לפלוט טקסט מוטה, פוגעני או בלתי הולם, ולכן חובה להריץ בדיקות בטיחות וסינון לפני שמחברים אותו למשתמשי קצה. מעבר לזה, הכרטיס לא מציג נתוני ביצועים שמראים מה נפגע בדחיסה ל־int4, כך שקיים סיכון לירידה באיכות הקוד או ביכולת החשיבה הלוגית.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב ביתי בלי כרטיס שרת?

כן, כל עוד יש לכם כרטיס מסך עם לפחות 24 גיגה זיכרון וידאו. הקבצים שוקלים 17.7 גיגה בייט, כך שהם נכנסים במלואם לזיכרון של כרטיס כזה, אבל תצטרכו להגביל את אורך ההקשר כדי לא לחרוג מהמקום הפנוי.

במה שונה גרסת ה־AutoRound ממודל המקור?

אינטל לקחו את המשקלים של קוון והמירו אותם למספרים של 4 ביט כדי לחתוך את צריכת הזיכרון בערך בחצי. הפעולה הזו מאפשרת הרצה זולה בהרבה, אך עלולה לפגוע מעט ברמת הדיוק בחלק מהמשימות.

איך מריצים

ההרצה הישירה מתבצעת דרך vllm בפקודת vllm serve פשוטה על פורט 8000 עם tensor-parallel-size של 1, מה שאומר שכרטיס מסך בודד עם 24 גיגה זיכרון יכול להחזיק אותו. הדוגמה הרשמית מגבילה את האורך ל־2048 טוקנים ומשתמשת ב־reasoning parser מובנה לקוון.

אם אתם מתכננים לנצל את מלוא חלון ההקשר של 262,144 טוקנים, כרטיס בודד כבר לא יחזיק את טבלת ה־KV ותצטרכו חומרה חזקה משמעותית או חלוקה בין כרטיסים. בעומסי עבודה נמוכים או אם אתם לא רוצים לתחזק שרת ייעודי שעולה כסף בכל חודש, קריאה ל־API חיצוני של שירות קיים תהיה זולה ופשוטה יותר.

pip install -U huggingface_hub
hf download Intel/Qwen3.6-27B-int4-AutoRound

הרישיון

הרישיון הרשום בעמוד הוא apache-2.0, שמאפשר שימוש מסחרי, שינוי קוד והפצה חופשית בלי תמלוגים. עם זאת, אינטל מדגישים בכרטיס המודל שיש לציית לתנאי הרישיון של מודל המקור Qwen3.6-27B וממליצים להיוועץ בעורך דין, כך שחובה לוודא שאין סתירה בין הרישיונות לפני שמשלבים אותו במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗