GPT
Q

Qwen3-VL-2B-Instruct-GGUF

קוד פתוח

Qwenapache-2.02025-10-31

  • transformers
  • gguf
  • image-text-to-text
  • endpoints_compatible
  • conversational

יש כאן גם סקירה על Qwen עצמו.

מודל ראייה ושפה קומפקטי שמגיע בפורמט מכווץ להרצה מקומית. הוא מיועד למי שצריך לפענח תמונות, וידאו וטקסט על חומרה צנועה בלי לשלוח מידע החוצה.

  • 7.1 GBמשקל הקבצים
  • 114,744הורדות בחודש
  • 60לייקים

מה זה

מדובר בגרסת שני מיליארד פרמטרים שמשלבת מודל שפה עם מפענח תמונה נפרד. הוא קורא תמונות ומסמכים, מנתח וידאו ברמת חלוקה לזמנים, וכולל חלון הקשר טבעי של 256 אלף טוקנים שניתן להרחבה עד מיליון. המודל מחלץ נתונים מממשקי משתמש, מייצר קוד ועיצובים מתוך צילומי מסך, ומבצע חילוץ טקסט מתמונות ב־32 שפות שונות, גם בתנאי תאורה חלשים או זוויות צילום עקומות.

הייחוד כאן הוא השילוב של ארכיטקטורת מיקום מתקדמת בזמן ובמרחב עם חיבור רב שכבתי של מאפייני תמונה. זה מאפשר לו להבין עומק, מיקומים יחסיים של עצמים במרחב והתרחשויות לאורך וידאו ממושך, ברמה שעד לאחרונה דרשה מודלי ענק. הוא גם מתוכנן לתפקד כסוכן ויזואלי שמזהה כפתורים ושדות במסכים ויודע להפעיל כלים בהתאם.

מתאים ל

  • סוכן בדיקות ממשק

    זיהוי כפתורים, קישורים ושדות בתוך צילומי מסך כדי להפעיל אוטומציות במחשב או בטלפון.

  • המרת עיצוב לקוד

    קריאת סקיצות או צילומי מסך והפיכתם לתחביר Draw.io, HTML או קוד לעיצוב אתרים.

  • חילוץ מידע ממסמכים וצילומים

    קריאת טקסטים בתנאי צילום קשים, תוויות ושלטים היישר מקבצי תמונה ללא שירות ענן חיצוני.

איפה זה נופל

למרות היכולות המרשימות לגודלו, מודל של שני מיליארד פרמטרים עדיין מוגבל מאוד בהיגיון מורכב לעומת מודלים גדולים. חילוץ הטקסט תומך ב־32 שפות אבל הכרטיס לא מפרט אילו שפות נתמכות, כך שאי אפשר לדעת מראש אם עברית עובדת היטב בלי לבדוק בפועל. המבנה שמחייב טעינת שני קבצים נפרדים דרך llama.cpp מסרבל מעט את ההטמעה, וחיבור קבצים מפוצלים דורש הקפדה על גרסאות עדכניות של כלי ההרצה.

אותה משפחה

Qwen3-VL יצא ב־22 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך מריצים מודל שפה עם תמונה דרך llama.cpp?

צריך להוריד שני קבצים נפרדים, קובץ המשקלים של מודל השפה וקובץ מפענח הראייה mmproj. בפקודת ההרצה מעבירים את מודל השפה בדגל m ואת מפענח הראייה בדגל mmproj יחד עם הנתיב לתמונה.

האם המודל תומך בעברית בחילוץ טקסט?

הכרטיס מציין תמיכה ב־32 שפות ללא פירוט שמותיהן. מכיוון שהתמיכה בשפות שאינן אנגלית שונה ממודל למודל, חובה לבדוק מסמכים בעברית לפני שמסתמכים עליו במוצר.

האם צריך כרטיס מסך חזק בשביל להריץ אותו?

לא בהכרח. קבצי המודל תופסים כ־7.1 גיגה בייט בגרסאות המלאות, ובגרסאות מכווצות כמו Q4 הוא צורך פחות זיכרון. אפשר להריץ אותו בצורה סבירה גם על מעבדים מודרניים, שבבי אפל או כרטיסי מסך בסיסיים.

איך מריצים

המשקל הכולל של הקבצים במאגר עומד על 7.1 גיגה בייט, והם מחולקים לשני רכיבים, מודל השפה ומפענח הראייה. אפשר להריץ אותו דרך llama.cpp, Ollama או כלים תואמי GGUF אחרים, ישירות על המעבד, על שבבי אפל סיליקון או על כרטיסי מסך של אנבידיה ואינטל. קיימות גרסאות דיוק שונות כמו FP16, Q8_0 ו־Q4_K_M למודל השפה, כך שניתן לערבב בין דיוק המפענח לחלק הטקסטואלי לפי כמות הזיכרון שיש לכם.

אם אתם צריכים רק מענה מהיר לבדיקה חד פעמית או שאין לכם מעבד גרפי פנוי, עדיף להשתמש בשרת קיים. הרצה מקומית שווה את ההתעסקות כשחייבים פרטיות מוחלטת, כשיש מגבלות תקשורת, או כשבונים מוצר שצריך לרוץ על מחשב הקצה של המשתמש.

ollama run hf.co/Qwen/Qwen3-VL-2B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, ולהפיץ אותו כחלק ממוצר סגור או פתוח. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗