GPT
Q

unsloth/Qwen3-VL-8B-Instruct-GGUF

קוד פתוח

unslothapache-2.02025-10-30

  • transformers
  • gguf
  • unsloth
  • image-text-to-text
  • endpoints_compatible

גרסת GGUF של מודל ראייה ושפה קומפקטי עם תמיכה בהקשר ארוך במיוחד. מתאים למי שרוצה לעבד תמונות, מסמכים וסרטוני וידאו באופן מקומי בלי להסתמך על שירותי ענן יקרים.

  • 133 GBמשקל הקבצים
  • 89,794הורדות בחודש
  • 64לייקים

מה זה

מדובר במודל רב תחומי בגודל 8 מיליארד פרמטרים שמתמקד בחיבור בין טקסט לתמונה. הוא כולל חלון הקשר טבעי של 256K שניתן להרחבה עד מיליון טוקנים, מה שמיועד לניתוח של ספרים שלמים או סרטוני וידאו ארוכים ברמת אינדוקס של שניות. המודל מתמודד עם זיהוי אובייקטים במרחב, הבנת ממשקי משתמש במחשב ובסלולר, ויכול לפלוט קוד כמו HTML, CSS ודיאגרמות מתוך תמונות.

בגזרה הטכנית שולבו מנגנוני מיקום חדשים לתמונה ולזמן כדי לשפר את ההבנה הרציפה של וידאו, יחד עם ארכיטקטורה שמחברת שכבות שונות של מעבד הראייה. מערך הנתונים שלו כולל OCR מורחב ל־32 שפות שמיועד לעבוד גם בתנאי צילום קשים, טקסט מטושטש ומסמכים מורכבים.

מתאים ל

  • חילוץ מידע ממסמכים וסריקות

    מנוע ה־OCR המשודרג מתמודד עם טקסט נטוי, תאורה חלשה ומבנים מורכבים ב־32 שפות שונות.

  • אוטומציה של ממשקי משתמש

    הבנת רכיבי מסך ביישומי מחשב ונייד מאפשרת להפעיל כלים ולבצע פעולות מבוססות תמונה.

  • המרת עיצובים לקוד תצוגה

    יכולת ייצור ישיר של קובצי HTML, CSS ודיאגרמות מתוך צילומי מסך ותרשימים.

איפה זה נופל

למרות ההבטחה לחלון הקשר ענק, הרצה של הקשרים באורך מאות אלפי טוקנים על חומרה מקומית מייצרת עומס חישובי אדיר וזמני תגובה ארוכים. המודל תומך ב־32 שפות ב־OCR אך הכרטיס לא מפרט את רשימת השפות, ולכן אין ערובה ליכולות שלו בעברית לפני בדיקה ישירה. בנוסף, מודל של 8 מיליארד פרמטרים עדיין מוגבל בהסקה לוגית מורכבת מול מודלים גדולים בהרבה.

אותה משפחה

Qwen3-VL יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

כמה זיכרון צריך בפועל כדי לעבוד איתו?

המשקל הכולל של כל הקבצים במאגר הוא 133 ג'יגה בייט, אך מדובר במספר גרסאות כימות שונות. להרצת גרסה מכומתת יחידה תצטרכו כרטיס מסך עם 12 עד 16 ג'יגה בייט של זיכרון וידאו למשימות רגילות. אם תרצו לנצל את חלון ההקשר המלא של 256K טוקנים, תזדקקו לזיכרון גדול בהרבה.

איך המודל מתמודד עם קריאת טקסט בעברית?

הכרטיס מצהיר על הרחבת יכולות ה־OCR ל־32 שפות לעומת 19 בגרסאות קודמות, אך אינו מפרט אילו שפות נתמכות בדיוק. לפני שמשלבים אותו במערכת מקומית, חובה להריץ בדיקה על מסמכים אמיתיים בעברית כדי לבדוק דיוק ויישור מימין לשמאל.

איך מריצים

המאגר כולל קובצי GGUF במשקל כולל של 133 ג'יגה בייט שמחולקים בין 32 קבצים ברמות כימות שונות, לצד תיקוני תבנית שיחה של Unsloth. כדי להריץ קובץ מכומת בודד של מודל 8B תצטרכו כרטיס מסך עם לפחות 12 עד 16 ג'יגה בייט של זיכרון וידאו, תלוי ברמת הדחיסה ובאורך ההקשר שתטענו.

אם אתם מתכננים להזין סרטונים ארוכים במיוחד או לנצל את מלוא חלון ההקשר, צריכת הזיכרון תזנק באופן משמעותי. במצב כזה, או אם אין לכם חומרה ייעודית מתאימה, שירות ענן יהיה זול ופשוט יותר לתחזוקה.

ollama run hf.co/unsloth/Qwen3-VL-8B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והמשקלים והפצה חופשית של תוצרים, ללא צורך בתשלום תמלוגים, ובלבד ששומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗