GPT
Q

Qwen3.5-9B-GGUF

קוד פתוח

unslothapache-2.02026-02-28

  • transformers
  • gguf
  • unsloth
  • image-text-to-text
  • endpoints_compatible

גרסת קוונטיזציה של מודל מולטימודלי בגודל בינוני, שמשלב עיבוד תמונה וטקסט. המטרה היא להריץ מקומית יכולות ראייה והסקה מתקדמות בלי להחזיק שרת כבד.

  • 138 GBמשקל הקבצים
  • 1,618,479הורדות בחודש
  • 894לייקים

מה זה

מדובר במודל שפועל על 9 מיליארד פרמטרים ומשלב טקסט ותמונה כבר בשלבי האימון הראשונים, לצד תמיכה רחבה ב־201 שפות ודיאלקטים. הארכיטקטורה שלו מערבת מנגנוני Gated DeltaNet עם שכבות תשומת לב מסוג Gated Attention כדי לחסוך זיכרון ולשמור על מהירות תגובה בזמן עיבוד נתונים ארוכים. המודל מתמודד טבעית עם הקשר של 262,144 טוקנים, וניתן להרחיב אותו עד מעל מיליון טוקנים בהתאם לחומרה.

במבחני ביצועים הוא עוקף מודלים גדולים ממנו בהרבה בחלק מהתחומים. ב־MMLU-Pro הוא משיג 82.5 נקודות, תוצאה שמנצחת מודלים של עשרות מיליארדי פרמטרים. במשימות של עבודה כסוכן כמו BFCL-V4 ו־TAU2-Bench הוא מציג ציונים של 66.1 ו־79.1 בהתאמה, מה שמעיד על הבנה טובה של הפעלת פונקציות וביצוע הוראות מורכבות.

מתאים ל

  • סוכני אוטומציה מבוססי כלים

    תוצאה של 79.1 במדד TAU2-Bench מתאימה מאוד למערכות שמריצות קריאות לפונקציות ודורשות מעקב קפדני אחרי הנחיות.

  • ניתוח מסמכים רב לשוניים

    תמיכה ב־201 שפות וחלון הקשר גדול מאפשרים סריקה של טקסטים ארוכים ותמונות בלי תלות בשירותי ענן.

  • אימון והתאמה מקומית

    התאימות המובנית לכלי Unsloth הופכת את תהליך ה־Fine-tuning המקומי לנגיש וחסכוני במשאבים.

איפה זה נופל

למרות ציונים מרשימים בהסקה כללית, המודל מתקשה במשימות תכנון מעמיקות ומציג תוצאה של 18.0 בלבד במבחן DeepPlanning. גם במבחני קוד מורכבים כמו OJBench הוא נעצר על 29.2 נקודות, פער בולט לעומת פתרונות מסחריים סגורים. בנוסף, חלון הקשר של מאות אלפי טוקנים תובעני מאוד מבחינת זיכרון מעשי, ובקצוות הקיבולת המהירות צונחת באופן דרסטי.

אותה משפחה

Qwen3.5 יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם צריך להוריד את כל 138 הגיגה-בייט כדי לעבוד איתו?

ממש לא. המאגר מכיל מגוון רחב של גרסאות דחוסות ברמות דיוק שונות, ואתם צריכים להוריד רק את קובץ ה־GGUF הבודד שמתאים לנפח הזיכרון של המחשב שלכם.

האם המודל יודע לנתח תמונות ישירות מתוך קובץ ה־GGUF?

כן, הארכיטקטורה נבנתה מראש לעבודה מולטימודלית עם רכיב ראייה מובנה. צריך רק לוודא שסביבת ההרצה שלכם, כמו vLLM או עוגן GGUF ייעודי, מוגדרת להזין קלטי תמונה לצד הטקסט.

איך מריצים

המאגר מכיל 28 קבצים בנפח כולל של 138 גיגה-בייט, שכוללים גרסאות קוונטיזציה שונות של Unsloth Dynamic 2.0 בפורמט GGUF. כדי להריץ קובץ בודד תצטרכו לבחור את רמת הדחיסה המתאימה לגודל הזיכרון שלכם, כאשר קובץ מכווץ בודד לוקח רק שבריר מסך הנפח הכולל של המאגר. המודל נתמך בספריות כמו vLLM, SGLang, Transformers ו־KTransformers לצד כלי Unsloth.

בשביל להריץ אותו כמו שצריך בזיכרון מלא עם הקשר רחב נדרש כרטיס מסך מודרני עם לפחות 16 עד 24 גיגה-בייט של זיכרון וידאו. אם אתם מתכננים לנצל את מלוא חלון ההקשר או עובדים על מחשב נייד פשוט ללא מאיץ גרפי חזק, החישוב המקומי יזחל ועדיף להשתמש ב־API מרוחק.

ollama run hf.co/unsloth/Qwen3.5-9B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של המשקלים, הפצה מחדש ושילוב במוצרים סגורים, בלי דרישה לפתוח את קוד המקור שלכם. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וכתב הוויתור על אחריות של המפתחים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗