GPT
Q

Qwen/Qwen3-VL-4B-Instruct-GGUF

קוד פתוח

Qwenapache-2.02025-10-31

  • transformers
  • gguf
  • image-text-to-text
  • endpoints_compatible
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת GGUF מכווצת למודל ראייה ושפה קטן יחסית, שמתאים למי שרוצה לעבד תמונות, וידאו ומסמכים מקומית בלי לגעת בשרתים חיצוניים.

  • 15.0 GBמשקל הקבצים
  • 89,187הורדות בחודש
  • 53לייקים

מה זה

מדובר במודל מולטימודלי בגודל 4 מיליארד פרמטרים שמחבר בין פענוח טקסט להבנת תמונה ווידאו. הוא מטפל במשימות ראייה מורכבות כמו ניתוח ממשקי משתמש, חילוץ קוד מתרשימים, זיהוי מרחבי בתלת ממד ופענוח וידאו ארוך לפי נקודות זמן מדויקות.

בגזרה הטקסטואלית והחזותית הוא כולל OCR מורחב ל־32 שפות ומסוגל לעבוד עם הקשר ארוך במיוחד של 256K טוקנים שמסוגל להימתח עד מיליון. עבור מודל בקנה מידה של 4B, היכולת להחזיק ספרים שלמים או שעות של וידאו לצד פיצוח שאלות מדעיות ומתמטיות מציבה רף גבוה מול מודלים מקבילים במשקל קל.

מתאים ל

  • המרת עיצובים לקוד

    יצירת מבני HTML, CSS או תרשימי Draw.io ישירות מצילומי מסך של ממשקים.

  • אוטומציית ממשק משתמש

    זיהוי אלמנטים על מסכי מחשב וטלפון לצורך הפעלת סוכנים שמבצעים פעולות באופן עצמאי.

  • ניתוח וידאו מבוסס זמן

    איתור אירועים מדויק לפי שניות בתוך קובצי וידאו ארוכים בזכות מנגנון מיפוי חזותי בזמן.

איפה זה נופל

מודלים בגודל 4B עדיין מועדים לטעויות בהסקה לוגית עמוקה ועלולים להמציא פרטים כשמעמיסים עליהם מסמכים צפופים מדי או תמונות עם רעש קיצוני. למרות שהרחבת ה־OCR כוללת 32 שפות, הכרטיס לא מפרט תמיכה מפורשת בעברית, ולכן חובה לבדוק איכות חילוץ טקסט מקומי באופן יזום לפני שמשלבים אותו בזרימת עבודה. בנוסף, חלון הקשר ענק דורש משאבי זיכרון אדירים שבפועל יאטו מאוד את המענה בחומרה ביתית.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך משלבים בין קובץ השפה לקובץ הראייה בריצה מקומית?

הריצה דורשת טעינה של שני קבצים במקביל דרך llama.cpp, אחד עבור ה־LLM והשני עבור ה־mmproj שמטפל בעיבוד התמונה. אפשר לבחור כיבוץ נמוך לשפה כמו Q4 כדי לחסוך זיכרון ולשמור על מקודד הראייה ברמת דיוק גבוהה יותר.

האם המודל יפעל בצורה חלקה בעברית?

המודל כולל OCR מורחב ל־32 שפות אבל הכרטיס לא מציין במפורש עברית ברשימה. מומלץ לבצע בדיקה נקודתית על מסמכים מקומיים כדי לראות אם הוא מתמודד היטב עם כיווניות ופונטים שונים.

איך מריצים

המשקל הכולל של הקבצים עומד על 15.0 ג'יגה בייט והם מחולקים לשני רכיבים נפרדים, מודל השפה ומקודד הראייה מסוג mmproj. החלוקה הזו מאפשרת לכם לערבב רמות כיבוץ שונות, למשל להריץ שפה בכיבוץ Q4_K_M וראייה ב־FP16 או Q8_0, ישירות דרך כלי GGUF מוכרים כמו llama.cpp ו־Ollama על מעבדי אינטל, כרטיסי אנבידיה או מחשבי אפל סיליקון.

אם אתם רצים על חומרת קצה מוגבלת או מחשב נייד בלי זיכרון ייעודי מספק, גרסת ה־Q4 תעבוד בסבירות גבוהה, אבל ברגע שצריך מהירות גבוהה לטעינת וידאו ארוך או הקשרים עצומים שזוללים זיכרון עבודה, שירות ענן מרוחק עדיף על גרירת המחשב האישי עד הקצה.

ollama run hf.co/Qwen/Qwen3-VL-4B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא apache-2.0, רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי קוד והפצה חופשית בתוך מוצרים. הדרישה המרכזית היא שמירה על הודעות זכויות היוצרים והצהרת הרישיון המקורית בקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗