GPT
Q

Qwen3.5-27B-FP8

קוד פתוח

Qwenapache-2.02026-02-25

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת 28 מיליארד פרמטרים בכימות מובנה שכוללת קלט תמונה וטקסט. היא מיועדת למי שרוצה ביצועים קרובים למודלים ענקיים על כרטיס גרפי בודד.

  • 28Bפרמטרים
  • 262,144טוקנים בהקשר
  • 28.8 GBמשקל הקבצים
  • 250,509הורדות בחודש

מה זה

מדובר במודל שמשלב ראייה ושפה ישירות מהאימון הבסיסי, עם ארכיטקטורה היברידית של שכבות Gated DeltaNet ורשתות קשב. הוא מגיע כבר מכומת לפורמט שמונה ביט בבלוקים של 128, כך שהמשקלים תופסים פחות מ־29 ג'יגה בייט על הדיסק בלי שצריך לכמת אותם לבד.

במדדי קוד והיגיון הוא עומד ראש בראש מול מודלים גדולים בהרבה. הוא משיג 72.4 ב־SWE-bench Verified ו־95.0 ב־IFEval, תוצאות שעוקפות מודלים בקנה מידה של מאות מיליארדי פרמטרים. המשמעות בפועל היא יכולת מעקב אחרי הוראות מורכבות וכתיבת קוד ברמה גבוהה מאוד, בחבילה שנכנסת לחומרה נגישה.

מתאים ל

  • סוכן בדיקות ותיקון קוד

    תוצאה של 72.4 ב־SWE-bench הופכת אותו למתאים לאיתור ותיקון תקלות במאגרי תוכנה.

  • עיבוד מסמכים משולבי תמונה

    ארכיטקטורת המולטימודל המובנית מתאימה לקריאה וניתוח של קבצים המכילים טקסט וגרפיקה.

  • אוטומציה מבוססת כלים

    עם ציון של מעל 68 במדד BFCL-V4, הוא מטפל היטב בקריאות לפונקציות ופקודות מערכת.

איפה זה נופל

למרות תוצאות חזקות בחלק מהמדדים, בפתרון בעיות אלגוריתמיות תחרותיות ב־CodeForces הוא מקבל ציון של 1899, נמוך בבירור מגרסאות המקור והמודלים הגדולים. גם בבדיקות תכנון ארוך ומשימות מסוף מורכבות הוא נעצר באזור ה־22 עד 41 אחוזים. מעבר לזה, הכרטיס לא מפרט כלל תוצאות של פענוח ויזואלי ספציפי או מבחנים בעברית, ולכן חובה לבדוק אותו עצמאית לפני שמסתמכים עליו לשפה המקומית או לקריאת מסמכים סבוכים.

אותה משפחה

Qwen3.5 יצא ב־20 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס של 24 ג'יגה בייט?

לא באופן ישיר. קובצי המודל עצמם שוקלים 28.8 ג'יגה בייט, ולכן הוא לא ייכנס במלואו לזיכרון של כרטיס יחיד כזה ללא חלוקה בין שני כרטיסים או הורדת רמת הדיוק עוד יותר.

האם הכימות המובנה פוגע ביכולות שלו?

לפי נתוני היצרן הביצועים כמעט זהים למודל המקורי. השימוש בפורמט FP8 מובנה חוסך את שלב הכימות העצמאי ומאפשר עלייה מהירה בסביבות כמו vLLM.

האם המודל תומך בעברית בצורה טובה?

החומר מציין תמיכה רחבה ב־201 שפות וניבים, אך אין נתוני מדידה קונקרטיים לגבי עברית. צריך לבצע הערכה ידנית על טקסטים מקומיים לפני שילוב במערכת.

איך מריצים

כדי לטעון את המשקלים צריך לפחות 32 ג'יגה בייט של זיכרון וידאו, כך שכרטיס בודד של 48 ג'יגה בייט כמו A6000 או צמד כרטיסי 24 ג'יגה בייט הם נקודת ההתחלה. המודל נתמך ישירות בספריות כמו vLLM, SGLang ו־transformers, ואין צורך בהמרת קבצים מוקדמת כי הוא כבר מכומת.

אם הכוונה היא לפתוח את חלון ההקשר המלא של 262 אלף טוקנים, דרישות הזיכרון ל־KV cache יקפצו משמעותית. בתרחיש כזה, או אם אין לכם שרת ייעודי זמין, עדיף לפנות ל־API חיצוני מאשר להחזיק אשכול שלם.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.5-27B-FP8")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצר סגור, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗