GPT
Q

Qwen3.5-2B

קוד פתוח

Qwenapache-2.02026-02-28

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל מולטימודלי קומפקטי שמנתח תמונה וטקסט עם חלון של רבע מיליון טוקנים. אתם תרצו אותו לבניית פרוטוטיפים ומשימות ספציפיות על חומרה מקומית צנועה.

  • 2.3Bפרמטרים
  • 262,144טוקנים בהקשר
  • 4.3 GBמשקל הקבצים
  • 3,115,741הורדות בחודש

מה זה

מדובר במודל שפה עם מקודד ראייה מובנה, שמטפל בקלט משולב של תמונה וטקסט ומחזיר טקסט. הארכיטקטורה שלו מערבבת שכבות Gated DeltaNet עם תשומת לב מסורתית כדי לאפשר פעולה מהירה וחסכונית. הוא מגיע עם תמיכה מוצהרת ב־201 שפות ודיאלקטים, וחלון הקשר מקורי ענק שמגיע ל־262,144 טוקנים.

במבחני שפה במצב חשיבה, הוא מציג תוצאות מעניינות. ב־MMLU-ProX הוא מגיע ל־52.3 ובבדיקת סוכנים כמו TAU2-Bench הוא משיג 48.8, תוצאה שעוקפת אפילו את גרסת ה־4B מהדור הקודם. בניתוח תמונות הוא רושם 50.3 במבחן MMMU-Pro. המספרים האלה מראים שהוא מחזיק יכולת הבנה והסקה מכובדת מאוד לנפח שלו, במיוחד במעקב אחרי הוראות מורכבות.

מתאים ל

  • פרוטוטיפ מקומי לסוכנים

    הוא משיג 48.8 ב־TAU2-Bench ומאפשר בדיקת זרימות עבודה של סוכנים אוטונומיים על חומרה זולה בלי עלויות קריאה.

  • חילוץ מידע מתמונות ומסמכים

    מקודד הראייה המובנה וציון 50.3 ב־MMMU-Pro מאפשרים ניתוח תרשימים והבנת קלט חזותי ישירות בתוך הפרומפט.

  • בסיס לכוונון משימה ייעודית

    משקל קל של 4.3 גיגהבייט ורישיון חופשי הופכים אותו למודל בסיס מעולה לפיין־טיונינג על דאטה ארגוני צר.

איפה זה נופל

יוצרי המודל מבהירים בעצמם שבגלל גודלו המצומצם, המטרות המרכזיות שלו הן פרוטוטיפים, מחקר וכוונון למשימות מוגדרות. הוא לא נועד לשמש מנוע ידע רחב ומוחלט. במבחני הסקה מתמטיים קשים הוא מתקשה באופן ברור, עם ציון של 22.9 בלבד ב־HMMT Feb 25 וציון של 19.6 ב־HMMT Nov 25. בנוסף, תוצאת AA-LCR של 25.6 מצביעה על כך שבחלונות הקשר ארוכים מאוד הוא מתחיל לפספס פרטים, ולכן לא כדאי להסתמך עליו בחיפוש מחט בערימת שחת בלי בדיקה מקדימה קפדנית.

אותה משפחה

Qwen3.5 יצא ב־20 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל מתאים לייצור בעומס גבוה?

הוא מתאים בעיקר אם מאמנים אותו מראש למשימה ספציפית ומוגדרת היטב. כמנוע כללי, היכולות המוגבלות שלו בהסקה מורכבת עלולות לייצר טעויות, כפי שהמפתחים עצמם מציינים כשהם מייעדים אותו לפרוטוטיפים ומחקר.

האם באמת אפשר לנצל חלון של 262 אלף טוקנים?

המודל תומך בזה טכנית, אבל התוצאות במבחן AA-LCR מראות ירידה בדיוק כשההקשר מתארך. עדיף לשמור על הקשר קצר יותר כשצריכים שליפה אמינה ומדויקת של פרטים בודדים.

איך מריצים

המשקל הכולל של הקבצים עומד על 4.3 גיגהבייט בפורמט Transformers, ולכן אפשר להריץ אותו בקלות על כרטיס מסך בודד בעל 8 עד 12 גיגהבייט זיכרון, או אפילו על מחשב נייד חזק דרך מעבד ומאיץ גרפי משולב. המפתחים תומכים ישירות בספריות כמו vLLM, SGLang, KTransformers ו־Transformers הרגילה.

אם אתם צריכים רק מענה נקודתי בלי לנהל תשתית, עדיף לפנות ל־API בענן. שרת ייעודי משתלם בעיקר אם חשוב לכם לעבד תמונות וטקסט באופן מקומי לגמרי מטעמי פרטיות או שיהוי נמוך, או אם אתם מתכננים לכוונן אותו על דאטה פנימי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.5-2B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. זה רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של המשקולות, שילוב במוצרים סגורים והפצה מחדש, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗