GPT
Q

Qwen3.5-35B-A3B-Base

קוד פתוח

Qwenapache-2.02026-02-24

  • transformers
  • safetensors
  • qwen3_5_moe
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת בסיס מולטימודלית שמפעילה רק 3 מיליארד פרמטרים מתוך 36 בזמן ריצה. מתאים למי שרוצה לאמן מודל ראייה ושפה על חומרה יחסית נגישה.

  • 36Bפרמטרים
  • 262,144טוקנים בהקשר
  • 67.0 GBמשקל הקבצים
  • 97,910הורדות בחודש

מה זה

מדובר במודל בסיס שמשלב טקסט ותמונה כבר משלב האימון המוקדם, בארכיטקטורת תערובת מומחים משולבת Gated Delta Networks. מתוך כמעט 36 מיליארד פרמטרים בסך הכול, רק שלושה מיליארד מופעלים בכל טוקן, מה שנותן מהירות ריצה של מודל קטן עם קיבולת ידע של מודל בינוני.

הוא כולל חלון הקשר ענק של 262,144 טוקנים ותמיכה רחבה במיוחד ב־201 שפות ודיאלקטים. בניגוד לחיבורים מאוחרים של מודלי ראייה נפרדים, כאן עיבוד התמונה מובנה ישירות בארכיטקטורה, והמפתחים שילבו טוקני שליטה כדי להקל על כיוונון עדין בשיטות כמו LoRA.

מתאים ל

  • בסיס לכיוונון עדין

    הוא כולל טוקני שליטה מובנים ומאפשר אימון LoRA יעיל בלי צורך לאמן מחדש את שכבת ה־embeddings הענקית.

  • ניתוח מסמכים ותמונות ארוכים

    חלון הקשר של מעל רבע מיליון טוקנים יחד עם קלט תמונה מאפשר לעבד חומר חזותי כבד ומסמכים מורכבים במקביל.

  • מערכות מרובות שפות

    האימון כלל 201 שפות ודיאלקטים, מה שנותן נקודת פתיחה מצוינת למוצרים שפונים לקהל מגוון ללא מודל נפרד לכל שפה.

איפה זה נופל

זה מודל בסיס בלבד ולא עבר אימון להוראות או לשיחה. הוא לא יענה לכם כמו צ'אטבוט, אלא ינסה להשלים טקסטים או תמונות, ולכן אסור להציג אותו למשתמשי קצה כפי שהוא. בנוסף, חלון ההקשר העצום דורש זיכרון עבודה נוסף משמעותי בזמן אמת, והכרטיס לא מספק ציוני ביצועים ספציפיים בעברית אלא רק הצהרה על תמיכה במאות שפות.

אותה משפחה

Qwen3.5 יצא ב־20 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

אפשר להשתמש בו ישירות לצ'אט עם משתמשים?

לא. זה מודל בסיס שמיועד להשלמת טקסט, כיוונון עדין ומחקר. בשביל שיחה ישירה צריך לאמן אותו קודם על הוראות או להשתמש בגרסת שיחה מתאימה.

למה צריך מודל של 36B אם רק 3B מופעלים?

חלוקת המומחים מאפשרת לו לאגור ידע ודיוק של מודל גדול, תוך שמירה על מהירות עיבוד ועלות חישוב של מודל קטן בהרבה. החיסרון הוא שעדיין חייבים מספיק זיכרון וידאו כדי להחזיק את כל המשקלים.

איך מריצים

המשקלים תופסים 67 ג'יגה בייט ב־25 קבצים, כך שצריך לפחות 80 ג'יגה זיכרון גרפי כמו כרטיס A100 או H100 בודד כדי לטעון אותו, או חלוקה על פני כמה כרטיסים קטנים יותר דרך vLLM או SGLang. בגלל שרק שלושה מיליארד פרמטרים פעילים בכל רגע, החישוב עצמו מהיר מאוד ברגע שהמשקלים כבר יושבים בזיכרון.

אם אתם לא מתכננים לאמן אותו בעצמכם או לבצע בדיקות ארכיטקטורה, עדיף להשתמש ב־API או לחכות לגרסת ה־Instruct. להחזיק שרת ייעודי רק בשביל מודל בסיס שלא עבר התאמה לשיחה זה מהלך יקר ומיותר לרוב הצוותים.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3.5-35B-A3B-Base")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מאפשר שימוש מסחרי מלא, שינוי של המשקלים, הפצה ושילוב במוצרים סגורים. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗