GPT
Q

Qwen3-VL-4B-Thinking

קוד פתוח

Qwenapache-2.02025-10-11

  • transformers
  • safetensors
  • qwen3_vl
  • image-text-to-text
  • conversational

יש כאן גם סקירה על Qwen עצמו.

גרסת חשיבה למודל ראייה ושפה ששוקלת 8.3 גיגה-בייט וכוללת 4.4 מיליארד פרמטרים. היא מתאימה למי שרוצה ניתוח תמונה, וידאו וקוד מורכב עם חלון של 256K טוקנים בחומרה מקומית.

  • 4.4Bפרמטרים
  • 262,144טוקנים בהקשר
  • 8.3 GBמשקל הקבצים
  • 47,133הורדות בחודש

מה זה

מדובר במודל שמשלב ראייה וטקסט עם יכולות חשיבה והסקה לוגית. בנפח של 4.4 מיליארד פרמטרים, הוא מתמודד עם משימות כמו הפעלת ממשקי משתמש במחשב ובנייד, יצירת קוד ויזואלי ישירות מתמונות, ופענוח מרחבי בתלת-ממד ודו-ממד.

הוא מביא שיפור משמעותי בניתוח מסמכים ווידאו ארוך. חלון ההקשר עומד על 256,144 טוקנים ויכול להתרחב למיליון, מה שמאפשר לעבד שעות של וידאו או ספרים שלמים עם איתור אירועים לפי חותמות זמן מדויקות. בנוסף, מנוע ה־OCR שלו תומך ב־32 שפות ומזהה טקסט גם בתנאי תאורה חלשים, טשטוש או זווית עקומה.

מתאים ל

  • אוטומציית ממשקי משתמש

    הוא מזהה רכיבים במסכי מחשב ונייד ומפעיל כלים להשלמת פעולות.

  • חילוץ קוד מעיצובים

    מייצר קוד HTML, CSS, JS ודיאגרמות Draw.io מתוך צילומי מסך.

  • אינדוקס וידאו ממושך

    סורק שעות של וידאו ברמת דיוק של שניות לפי חותמות זמן מוגדרות.

איפה זה נופל

המודל מגיע בגרסת חשיבה, מה שאומר שזמן המענה ארוך יותר כי הוא מייצר שרשרת הסקה לפני התשובה הסופית. הגדרות היצרן דורשות אורך פלט מקסימלי של עשרות אלפי טוקנים, מה שמייצר עומס כבד על הזיכרון וזמני השהיה מורגשים. בנוסף, למרות ההבטחה לזיהוי של 32 שפות ב־OCR, אין תיעוד מפורט לגבי רמת הדיוק בעברית, ולכן חובה לבדוק אותו על מסמכים מקומיים לפני שסומכים עליו בזיהוי תווים.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איזו גרסת transformers נדרשת להרצה?

הכרטיס ממליץ להתקין את transformers ישירות ממאגר ה־git של Hugging Face. גרסה 4.57.0 טרם שוחררה רשמית בזמן הפרסום, ולכן עבודה עם התקנה ישנה תיכשל בזיהוי הארכיטקטורה.

האם המודל מיועד לצ'אט מהיר בזמן אמת?

לא ממש. גרסת ה־Thinking מנתחת צעדי חשיבה ומפיקה פלטים ארוכים מאוד שנועדו להסקה מורכבת במתמטיקה וקוד, כך שזמן התגובה הראשוני איטי יותר מגרסאות רגילות.

איך מריצים

טוענים את המשקלים דרך ספריית transformers העדכנית, ישירות מהקוד במאגר הגיטהאב שלהם. הקבצים שוקלים 8.3 גיגה-בייט, כך שאפשר להריץ אותם על כרטיס גרפי בודד עם זיכרון ייעודי צנוע יחסית בלי להזדקק לחוות שרתים מורכבת.

אם אתם רוצים לדחוף את ההקשר לקצה של 256K טוקנים, תצטרכו נפח זיכרון משמעותי בהרבה עבור ה־KV Cache. במצב שבו אין לכם חומרה ייעודית עם מספיק VRAM להקשר מלא, שווה להשתמש בפתרון ענן במקום לחנוק את המחשב המקומי.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen3-VL-4B-Thinking")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים זמינים תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה פנימית או חיצונית כחלק ממוצר, בתנאי ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗