GPT
Q

Qwen3-VL-4B-Instruct-GGUF

קוד פתוח

unslothapache-2.02025-10-30

  • transformers
  • gguf
  • unsloth
  • qwen
  • qwen3

עיבוד תמונה, וידאו וטקסט בחבילה קומפקטית שמסוגלת לרוץ מקומית. הפתרון הזה נותן יכולות של מודל ראייה מתקדם בלי לדרוש שרת ייעודי כבד.

  • 66.3 GBמשקל הקבצים
  • 321,563הורדות בחודש
  • 74לייקים

מה זה

מדובר במודל רב-מודאלי שמטפל בקלט משולב של תמונה, וידאו וטקסט. המודל מביא תמיכה בהקשר בסיסי של 256K שמסוגל להתרחב עד 1M טוקנים, מה שמאפשר לו לנתח ספרים שלמים או סרטוני וידאו של שעות עם אינדוקס לפי שניות. הארכיטקטורה שלו כוללת שילוב של Interleaved-MRoPE וחיבור רב-שכבתי של מאפייני ראייה דרך DeepStack, כדי לחזק את ההבנה המרחבית ולדייק בפרטים קטנים.

בגזרה המעשית, הוא משלב מנוע OCR מורחב שתומך ב־32 שפות ומסוגל לקרוא מסמכים בתנאי צילום קשים, כמו טשטוש או זווית עקומה. בנוסף, הוא פועל כסוכן ויזואלי לממשקי מחשב וטלפון, ומסוגל להמיר עיצובים מקובצי תמונה ישירות לקוד HTML, CSS, JS או תרשימי Draw.io.

מתאים ל

  • חילוץ נתונים ממסמכים וטפסים

    מנוע ה־OCR המשודרג מתמודד היטב עם צילומים עקומים ומטושטשים בעשרות שפות שונות.

  • המרת סקיצות לקוד אתרים

    יודע לתרגם ישירות תמונות ותרשימים למבנה של HTML, CSS ו־JavaScript מוכן.

  • תחקור ותיוג של קובצי וידאו

    חלון ההקשר העצום מאפשר להזין סרטונים ארוכים ולאתר אירועים לפי חותמת זמן.

איפה זה נופל

למרות ההבטחות על תמיכה ב־32 שפות ב־OCR, רשימת השפות המדויקת לא מפורטת בתיעוד, ולכן חובה לבדוק את הביצועים שלו על טקסט עברי לפני שמשלבים אותו בזרימת עבודה. מעבר לזה, קריאה ממסכי טלפון או מחשב בתור סוכן אוטונומי דורשת דיוק מושלם, ובמודל של 4B יש נטייה לפספס אלמנטים קטנים ביחס למודלי ענק. צריך גם לקחת בחשבון שהרצת וידאו מלא עם הקשר עמוק תדרוש משאבים כבדים בהרבה מסתם פענוח תמונה בודדת.

אותה משפחה

Qwen3-VL יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה כרטיס מסך אני צריך בשביל להריץ אותו?

עבור מודל של 4B בכיול סטנדרטי של 4-bit, מספיק כרטיס עם 6 עד 8 גיגה-בייט זיכרון כדי להריץ תמונות וטקסט קצר. אם תרצו לטעון סרטוני וידאו שלמים שמנצלים עשרות אלפי טוקנים, תצטרכו כרטיס עם זיכרון גדול בהרבה כדי להחזיק את כל ההקשר.

למה יש 32 קבצים בהורדה ששוקלים מעל 66 גיגה-בייט?

המאגר כולל מגוון רמות כיול שונות בפורמט GGUF, ולא צריך להוריד את כולן. אתם בוחרים רק את הקובץ המתאים לרמת הדחיסה ונפח הזיכרון שזמין לכם במחשב.

איך מריצים

המודל מופץ כאן בפורמט GGUF על ידי צוות Unsloth, שכולל תיקונים לתבנית הצ'אט. ההפצה כוללת 32 קבצים שונים ששוקלים יחד 66.3 גיגה-בייט, ומכילים ככל הנראה מגוון רחב של כיולים בגדלים שונים. כדי להריץ אותו צריך להתקין את ספריית transformers ישירות מגרסת הפיתוח של גיטהאב או לחכות לשחרור הרשמי של גרסה 4.57.0.

בגלל שמדובר במודל של ארבעה מיליארד פרמטרים, גרסאות מכוילות שלו יכולות לרוץ בקלות על כרטיס מסך ביתי בודד או אפילו במעבד עם מספיק זיכרון RAM. אם אתם מתכוונים לפתוח את כל חלון ההקשר עד למקסימום עם וידאו ארוך, דרישות הזיכרון יקפצו משמעותית, ובמצב כזה שווה לשקול פנייה לשרת מרוחק.

ollama run hf.co/unsloth/Qwen3-VL-4B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מפורסם תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה חופשית של המודל בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והצהרת הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗