GPT
Q

Qwen3-VL-8B-Instruct-GGUF

קוד פתוח

Qwenapache-2.02025-10-31

  • transformers
  • gguf
  • image-text-to-text
  • endpoints_compatible
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת GGUF למודל ראייה ושפה בגודל שמונה מיליארד פרמטרים שרץ מקומית. הוא בנוי לעבודה עם תמונות, וידאו ארוך וטקסט בלי תלות בשרתים חיצוניים.

  • 29.8 GBמשקל הקבצים
  • 94,833הורדות בחודש
  • 141לייקים

מה זה

המודל משלב מפענח טקסט ומקודד ראייה נפרד בפורמט GGUF, מה שמאפשר להריץ אותו דרך llama.cpp או Ollama על מחשב מקומי. הוא מתמודד עם ניתוח תמונות, הפקת קוד מתוך ממשקים גרפיים ופענוח וידאו ברמת דיוק של שניות לפי חותמות זמן.

לפי הנתונים שפורסמו, ארכיטקטורת הראייה שלו משתמשת בשכבות מרובות של פיצ'רים כדי לזהות פרטים קטנים, ותומכת בחלון הקשר בסיסי של 256K שניתן להרחבה עד מיליון טוקנים. בתחום הראייה הוא כולל OCR מורחב ל־32 שפות ומסוגל לזהות מיקומים תלת־ממדיים של אובייקטים במרחב.

מתאים ל

  • המרת עיצובים לקוד

    הוא מנתח תמונות ממשק ויוצר ישירות קובצי HTML, CSS, JavaScript או תרשימי Draw.io.

  • ניתוח וידאו ארוך

    הקשר של 256K טוקנים מאפשר לסרוק שעות של צילום ולאתר אירועים לפי חותמות זמן מדויקות.

  • חילוץ טקסט ממסמכים קשים

    מנוע ה־OCR שלו מותאם לתמונות מטושטשות, צילום בזווית עקומה ופענוח מסמכים מורכבים.

איפה זה נופל

המודל דורש ניהול ידני של שני קבצים נפרדים וגרסה עדכנית במיוחד של כלי ההרצה כדי לפעול. מעבר לכך, התמיכה בהקשר של מאות אלפי טוקנים ובווידאו ארוך תדרוש משאבי זיכרון כבדים מאוד שלא תמיד מעשיים בריצה מקומית, ויש לוודא מראש אם 32 שפות ה־OCR כוללות עברית, שכן רשימת השפות המדויקת לא מפורטת בכרטיס.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך טוענים את המודל לתוך llama.cpp?

מעבירים לפקודת ההרצה את הדגל m עבור קובץ השפה ואת הדגל mmproj עבור מקודד הראייה. שרת המערכת יטען את שניהם ויפתח ממשק רשת בכתובת המקומית.

אפשר לשלב בין רמות כימות שונות?

כן. ניתן להריץ את מודל השפה בכימות נמוך כמו Q4_K_M כדי לחסוך זיכרון, ולהשאיר את מקודד הראייה ב־Q8_0 או FP16 לשמירה על חדות התמונה.

איך מריצים

כדי להריץ אותו צריך לטעון שני קבצים במקביל: משקולות הטקסט וקובץ הראייה mmproj. הגרסאות נעות בין FP16 מלא לכימותים כמו Q8_0 ו־Q4_K_M, כך שאפשר לחסוך בזיכרון על ידי בחירת רמות דיוק שונות לחלק הוויזואלי ולשפה.

ההרצה נתמכת במעבדי CPU, כרטיסי מסך של NVIDIA, שבבי Apple Silicon ו־Intel SYCL דרך כלי שורת הפקודה או שרת מקומי תואם OpenAI. אם אין לכם זיכרון גרפי ייעודי מתאים להחזקת שני הרכיבים יחד, המהירות תרד משמעותית במעבד רגיל.

ollama run hf.co/Qwen/Qwen3-VL-8B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו מחדש ולשלב אותו במוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗