GPT
Q

Qwen3.5-4B-Base

קוד פתוח

Qwenapache-2.02026-02-27

  • transformers
  • safetensors
  • qwen3_5
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת בסיס מולטימודלית קומפקטית שמשלבת טקסט ותמונה כבר באימון הראשוני. היא מיועדת בעיקר למי שמתכנן אימון המשך או התאמה אישית, ולא לשיחה ישירה מהקופסה.

  • 4.7Bפרמטרים
  • 262,144טוקנים בהקשר
  • 8.7 GBמשקל הקבצים
  • 521,377הורדות בחודש

מה זה

מדובר במודל שמקבל תמונה וטקסט ומחזיר טקסט, בגודל של כמעט 4.7 מיליארד פרמטרים. השוני המרכזי מול מודלים קודמים בגודל הזה הוא חיבור מוקדם בין הראייה לשפה, במקום להדביק מתאם ראייה על מודל טקסט קיים. הארכיטקטורה משלבת שכבות מסוג Gated DeltaNet עם שכבות תשומת לב רגילות כדי לשמור על מהירות עיבוד גבוהה.

הוא מגיע עם חלון הקשר טבעי של 262,144 טוקנים שניתן להרחבה עד מעל מיליון לפי התיעוד. החברה מדווחת על תמיכה ב־201 שפות ודיאלקטים, וטוענת לעליונות על פני דגמי הדור הקודם בתכנות, היגיון והבנה חזותית, אם כי הכרטיס הנוכחי לא מציג טבלת ציונים מפורטת עם מספרים מדויקים.

מתאים ל

  • אימון ייעודי עם תמונות

    משלב ראייה ושפה מראש, וכולל טוקני בקרה מוכנים להתאמת LoRA מהירה.

  • ניתוח מסמכים ארוכים

    חלון הקשר ענק שמתחיל ב־262,144 טוקנים ומאפשר טעינת טקסט ותמונות יחד.

  • מערכות עם משאבים מוגבלים

    גודל קבצים של 8.7 גיגה בייט בלבד מאפשר הרצה מקומית על כרטיס מסך יחיד.

איפה זה נופל

זהו מודל בסיס שעבר אימון מקדים בלבד. הוא לא עבר יישור סופי למתן תשובות, ולכן הוא נוטה להשלים טקסט במקום לענות על פקודות בצורה מסודרת. המפתחים עצמם מציינים שהוא לא מיועד לאינטראקציה ישירה אלא כבסיס לעבודה. בנוסף, אף שהוכנסו מראש טוקני בקרה כדי להקל על LoRA, תצטרכו להשקיע זמן ומשאבים בכוונון עדין לפני שהוא יהיה שמיש במוצר אמיתי.

אותה משפחה

Qwen3.5 יצא ב־20 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות כבוט לשירות לקוחות?

לא מומלץ בכלל. זהו מודל בסיס שמיועד להשלמת טקסט ולא למענה על שאלות. כדי להשתמש בו במוצר מול לקוחות, צריך לבצע קודם אימון ייעודי או להשתמש בגרסת Instruct מותאמת.

איך הארכיטקטורה משפיעה על מהירות הריצה?

השילוב של Gated DeltaNet עם תשומת לב מסורתית נועד לאפשר טיפול בהקשרים ארוכים בלי לפגוע בקצב עיבוד הטוקנים ובזיכרון. זה עוזר לשמור על השהיה נמוכה יחסית גם כשטוענים הרבה מידע.

איך מריצים

המשקל הכולל של הקבצים עומד על 8.7 גיגה בייט, כך שאפשר להריץ אותו בקלות על כרטיס מסך בודד עם 12 או 16 גיגה זיכרון, במיוחד בסביבות כמו vLLM, SGLang או Transformers הרגיל.

אם אתם רוצים רק צ'אט מהיר שעונה להוראות בלי לעבור תהליך אימון, עדיף להשתמש בגרסת Instruct או בשירות ענן מוכן. המודל הזה דורש כוונון כדי להתנהג כמו שצריך בשיחה מול משתמש.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.5-4B-Base")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים ולהפיץ מוצרים המבוססים עליו, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗