GPT
Q

Qwen_Qwen3.5-4B-GGUF

קוד פתוח

bartowskiapache-2.02026-02-27

  • gguf
  • image-text-to-text
  • endpoints_compatible
  • conversational

פתרון מכווץ לעיבוד תמונה וטקסט שרץ מקומית גם על מחשבים פשוטים. הוא מתאים למי שחייב מודל מולטימודלי קל בלי להסתמך על שירותי ענן.

  • 71.8 GBמשקל הקבצים
  • 423,432הורדות בחודש
  • 50לייקים

מה זה

מדובר בהמרה של גרסת 4B מבית Qwen לפורמט GGUF, שמיועדת לעבודה עם llama.cpp וכלים דומים. המודל מבצע משימות של ניתוח תמונה לצד הפקת טקסט, ומגיע בשלל רמות כיול ודחיסה שמבוססות על imatrix. הוא כולל תמיכה בשכבות MTP לטובת speculative decoding בדחיפות תואמות, מה שמסייע לחלץ קצב הפקה גבוה יותר מהחומרה.

בגודל הזה יש מעט מאוד אפשרויות שמשלבות ראייה וטקסט בצורה שנכנסת כמעט לכל מעבד גרפי ביתי. המדידות ההיסטוריות על מעבדי שרתים מראות הבדלים ניכרים בין דחיסות שונות, כשדחיסת Q4_0 מייצרת סביב 40 טוקנים לשנייה בעיבוד רציף אך מפגרת מול Q4_K_M בניתוח מהיר של הפרומפט עצמו.

מתאים ל

  • ניתוח תמונות במכשיר קצה

    הוא שוקל סביב שלושה גיגהבייט בגרסת Q4 ומסוגל לעבד קלט ויזואלי במחשב מקומי.

  • סיווג מסמכים וטפסים

    הוא מקבל תמונה ומחזיר טקסט ישירות, בלי להוציא נתונים רגישים לשרתים חיצוניים.

  • עוזר מקומי למחשבים ניידים

    צריכת הזיכרון הנמוכה שלו מאפשרת להריץ שיחות וראיית מכונה במקביל לעבודה שוטפת.

איפה זה נופל

מודל של 4 מיליארד פרמטרים שמתעסק גם בתמונה מוגבל מאוד ביכולת ההסקה המורכבת שלו. הדחיסות הנמוכות, מ־Q3 ומטה, מוגדרות בגלוי כבעלות איכות ירודה או נמוכה מאוד, ולא הייתי משתמש בהן לחילוץ נתונים מדויק מטקסטים או מתמונות. מעבר לכך, הכרטיס מציין שרמות דחיסה מודרניות בפורמט IQ עלולות לעבוד לאט מאוד אם מריצים אותן על מעבד בלבד ללא האצת חומרה.

אותה משפחה

Qwen-Qwen3.5 יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד מהרשימה?

עבור רוב השימושים, קובץ Q4_K_M הוא הבחירה המאוזנת ביותר בין שמירה על דיוק לגודל של 3.01GB. אם יש לכם זיכרון גרפי פנוי של מעל 6GB, אפשר לקחת את Q5_K_M או Q6_K לקבלת איכות קרובה למקור.

האם המודל יעבוד טוב על מחשב בלי כרטיס מסך של אנבידיה?

כן, llama.cpp מאפשר הרצה על המעבד, וגרסאות כמו Q4_0 או IQ4_NL מותאמות לעבודה ישירה על ארכיטקטורת ARM ופקודות AVX. עם זאת, קחו בחשבון שדחיסות מסוג IQ יהיו אטיות משמעותית על המעבד לעומת כרטיסי מסך שתומכים בהאצה.

איך מריצים

טוענים קובץ יחיד ישירות לתוך llama.cpp, LM Studio, או Jan AI. הגרסאות המומלצות מתחילות מקובץ Q4_K_M במשקל של כ־3.01GB, שדורש מעט מאוד זיכרון ונכנס בקלות לכל כרטיס מסך עם 6GB או 8GB זיכרון. אם המטרה היא מהירות מרבית, דואגים שכל הקובץ יישב בזיכרון הגרפי.

עבור חומרה מוגבלת מאוד יש גרסאות קיצוניות יותר כמו IQ2_M שיורדת ל־1.95GB, אך האיכות בהן נשחקת. אם אתם זקוקים לתשובות ארוכות במיוחד מקבצים כבדים ואין לכם כרטיס מסך ייעודי, עדיף לפנות ישירות ל־API מרוחק במקום להעמיס על המעבד המקומי.

ollama run hf.co/bartowski/Qwen_Qwen3.5-4B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקבצים, להטמיע אותו במוצרים פנימיים או חיצוניים ולהפיץ אותו הלאה. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה של המוצר.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗