GPT
Q

Qwen3.6-27B-FP8

קוד פתוח

Qwenapache-2.02026-04-21

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת קוונטיזציה רשמית של 28 מיליארד פרמטרים שמיועדת למשימות תכנות וסוכנים. היא מביאה יכולות ראייה וטקסט עם הקשר ענק של 262,144 טוקנים ישירות לשרת המקומי.

  • 28Bפרמטרים
  • 262,144טוקנים בהקשר
  • 28.8 GBמשקל הקבצים
  • 7,198,015הורדות בחודש

מה זה

מדובר במודל מולטימודלי שמקבל תמונות וטקסט ומייצר טקסט, המבוסס על שילוב של שכבות Gated DeltaNet ורישות קשב רגיל. הדגש המרכזי כאן הוא שיפור חד ביכולות תכנות אוטונומיות, ניווט בריפוזיטורי שלם ושמירה על רצף המחשבה משיחות קודמות כדי לחסוך חישוב חוזר בעבודה איטרטיבית.

במדדי ביצועים המודל מציג זינוק ברור מול הדור הקודם ומול מתחרים באותו סדר גודל. בבדיקת SWE-bench Verified הוא מגיע לציון של 77.2 לעומת 52.0 של מודל מקביל כמו Gemma4-31B, ובמבחן הטרמינל Terminal-Bench 2.0 הוא משתווה לביצועים של מודלי ענק סגורים עם 59.3 נקודות.

מתאים ל

  • סוכן תכנות מקומי

    מתאים לביצוע משימות קוד אוטונומיות בקבצי הפרויקט בזכות ציון 77.2 ב־SWE-bench וחלון עבודה נרחב.

  • ניתוח מסמכים ותמונות

    מאפשר עיבוד משולב של דיאגרמות, צילומי מסך וטקסט ארוך בזכות יכולות הראייה וההקשר של 262,144 טוקנים.

  • פיתוח איטרטיבי ממושך

    מנצל את מנגנון שימור ההקשר הפנימי כדי להמשיך סשן עבודה ארוך בלי לבזבז כוח חישוב על היסטוריית החשיבה.

איפה זה נופל

למרות השדרוג בקוד, במשימות היגיון קיצוניות המודל עדיין מתקשה. במבחן HLE הוא נעצר על ציון של 24.0, ובפתרון משימות ריפו מורכבות במבחן NL2Repo הוא משיג רק 36.2 נקודות, רחוק מביצועי מודלי ענן גדולים. בנוסף, קוונטיזציית FP8 דורשת בדיקה קפדנית של דיוק הפלט מול המשימות הספציפיות שלכם, שכן פעולות עדינות עלולות להיפגע ביחס לגרסת המשקל המלאה.

אותה משפחה

Qwen3.6 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ את המודל על כרטיס צרכני בודד של 24 גיגה בייט?

לא. משקל המשקלים לבדו הוא 28.8 גיגה בייט, כך שהוא לא ייכנס בזיכרון של כרטיס בודד כזה. תצטרכו לפחות כרטיס של 48 גיגה בייט או לחלק את העומס בין שני כרטיסים.

מה ההבדל בביצועים בין גרסת ה־FP8 לגרסה הרגילה?

לפי מפתח המודל, שיטת הקוונטיזציה היא ברזולוציה עדינה עם גודל בלוק של 128, והמדדים שלה כמעט זהים לחלוטין לגרסת המשקל המקורית. אתם מקבלים חיסכון בנפח כמעט בלי איבוד דיוק.

איך מריצים

המשקל הכולל של הקבצים עומד על 28.8 גיגה בייט בפורמט FP8 עם גודל בלוק 128, מה שאומר שאתם חייבים כרטיס גרפי מודרני שתומך בחישוב נקודה צפה בשמונה ביט. בשביל להריץ אותו עם חלון הקשר סביר תצטרכו כרטיס בודד של 48 גיגה בייט זיכרון גרפי, או מערך של שני כרטיסי 32 או 24 גיגה בייט, באמצעות vLLM, SGLang או Transformers.

אם אתם מתכננים לנצל את מלוא חלון ההקשר המקורי של 262,144 טוקנים, דרישות הזיכרון לטבלת ה־KV יזנקו בצורה חדה. בתרחיש כזה, או אם אין לכם חומרה ייעודית שתומכת ב־FP8, החזקת שרת פרטי תהפוך ליקרה מדי ועדיף לפנות ל־API חיצוני.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.6-27B-FP8")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון Apache 2.0 מלא. הרישיון מתיר שימוש מסחרי, שינוי קוד, הפצה מחדש והטמעה מלאה בתוך מוצרים, ללא צורך בתשלום תמלוגים, ובתנאי שאתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗