GPT
Q

Qwen3.8-27B-FP8

קוד פתוח

Qwenapache-2.02026-08-13

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת FP8 דחוסה של מודל מולטימודלי בגודל 28 מיליארד פרמטרים. הוא מיועד למי שרוצה יכולות קוד, ראייה והסקה מתקדמות על חומרה מקומית נגישה יחסית.

  • 28Bפרמטרים
  • 262,144טוקנים בהקשר
  • 28.8 GBמשקל הקבצים
  • 6,985,465הורדות בחודש

מה זה

מדובר במודל שמנתח טקסט, תמונות וסרטוני וידאו ארוכים, ומחזיר טקסט. הארכיטקטורה משלבת שכבות Gated DeltaNet יחד עם Gated Attention ומנגנון חיזוי רב טוקנים. הגרסה הזו מגיעה מכווצת מראש בכיול FP8 עם בלוקים של 128, כך שהיא שומרת על ביצועים כמעט זהים למקור אבל חוסכת משמעותית במקום.

במבחני ביצועים הוא בולט במיוחד במשימות תכנות מעשיות ועבודה מול טרמינל. במבחן SWE-bench Pro הוא קיבל 61.7 וב־LiveCodeBench v6 הגיע ל־90.3, תוצאות שעוקפות מודלים גדולים בהרבה. גם במשימות סוכן כמו CoWorkBench שבוחן עבודה משרדית מורכבת הוא רשם 70.7, מה שמראה שהוא מחזיק תהליכים מרובי שלבים בצורה יציבה.

מתאים ל

  • סוכני פיתוח ותיקון קוד

    התוצאה של 61.7 ב־SWE-bench Pro מציבה אותו כבחירה מצוינת לטיפול אוטונומי בריפוזיטורי ובדיקות קוד.

  • ניתוח מסמכים ותרשימים

    התמיכה המובנית בעיבוד תמונות וסרטונים מאפשרת לחלץ תובנות מתרשימי STEM ומסמכים סרוקים ישירות למערכת.

  • אוטומציה של משימות משרד

    עם ציון של 70.7 ב־CoWorkBench, הוא מתאים להובלת תהליכים מורכבים בפיננסים, משפטים ומנהלה.

איפה זה נופל

במבחן HLE שבודק הסקה רב תחומית קשה המודל קיבל רק 30.8 לעומת 40.0 של Opus4.6 Max. במבחן Agents' Last Exam שמעמיד רף קיצוני למשימות סוכן התוצאה עומדת על Pass@1 של 20.4 בלבד. קחו בחשבון שמצב החשיבה דולק כברירת מחדל, ואם לא שולטים בו דרך הגדרות כמו reasoning_effort הוא ייצר זמני תגובה ארוכים מהרצוי.

אותה משפחה

Qwen3.8 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם הקוונטיזציה של FP8 פוגעת באיכות התוצאות?

הכרטיס מדווח על כיול מדויק בגושים של 128 ששומר על מדדי ביצוע כמעט זהים לחלוטין למודל המקורי. השימוש בפורמט הזה מאפשר לחסוך זיכרון יקר בלי לאבד יכולות הסקה.

איך מונעים מהמודל להאריך בתשובות בגלל מנגנון החשיבה?

מצב החשיבה מופעל כברירת מחדל אך ניתן לכיבוי בכל בקשה. בנוסף אפשר לווסת את עומק ההסקה בעזרת הפרמטר reasoning_effort כדי לקצר זמנים.

האם אפשר להריץ עליו הקשר של מיליון טוקנים מקומית?

המודל תומך טבעית בעד 262,144 טוקנים, וניתן להרחיב אותו עד מיליון. עם זאת, הקצאת זיכרון להקשר כזה על חומרה מקומית דורשת משאבים עצומים, ולכן להקשרים מקסימליים עדיף להשתמש ב־API.

איך מריצים

כדי להריץ את המודל צריך כרטיס מסך מודרני שתומך בחישובי FP8 טבעיים. משקל הקבצים הוא 28.8 גיגה בייט, כך שכרטיס בודד של 32 או 48 גיגה בייט זיכרון וידאו מספיק להרצה בסיסית, אבל ניצול חלון ההקשר העצום ידרוש הרבה יותר זיכרון עבור ה־KV cache.

המשקלים נתמכים ישירות בספריות כמו Transformers, vLLM, SGLang ו־TokenSpeed. אם אין לכם חומרה ייעודית שפנויה למשימה, שירות ענן מנוהל כמו Qwen Cloud עדיף, בעיקר כי הוא מציע כברירת מחדל הרחבה של חלון ההקשר עד מיליון טוקנים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.8-27B-FP8")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון קוד פתוח מסוג Apache 2.0. זהו רישיון מתירני שמאפשר שימוש מסחרי, שינוי של הקוד, הפצה מחדש והטמעה במוצרים סגורים, כל עוד שומרים על הודעות זכויות היוצרים וההצהרות המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗