GPT
Q

Qwen3-VL-30B-A3B-Instruct-GGUF

קוד פתוח

unslothapache-2.02025-10-30

  • gguf
  • unsloth
  • qwen
  • qwen3_vl_moe
  • image-text-to-text

גרסת GGUF למודל ראייה ושפה שמשלב יכולות סוכן ויזואלי וניתוח וידאו ארוך. הוא מיועד למי שרוצה להריץ לוקאלית מודל מולטימודלי כבד עם תמיכה בהקשר של 256K.

  • 476 GBמשקל הקבצים
  • 39,339הורדות בחודש
  • 111לייקים

מה זה

המודל מגיע מארכיטקטורת MoE שמפעילה רק חלק מהפרמטרים בכל שלב, מה שמאפשר לו לתפקד כמודל ראייה גדול בלי לשלם את כל מחיר החישוב של מודל צפוף. הוא מנתח תמונות, וידאו של שעות ומסמכים מורכבים. המפתחים הטמיעו בו מנגנוני מיקום מתקדמים בזמן ובמרחב כדי להבין תנועה בווידאו ומיקום של אובייקטים בדו מימד ובתלת מימד.

בניגוד לגרסאות קודמות, הדגש כאן הוא על פעולה כסוכן שיודע לנווט בממשקי משתמש של מחשב ונייד, לחלץ קוד כמו HTML או Draw.io מתמונות, ולבצע OCR ב־32 שפות שונות גם בתנאי צילום קשים כמו טשטוש והטיה. הנתונים הטכניים מעידים על שילוב הדוק בין שכבות הראייה לטקסט במטרה למנוע איבוד מידע במעבר בין תמונה למילים.

מתאים ל

  • ניתוח וידאו ארוך

    תמיכה מובנית בחלון הקשר של 256K מאפשרת תחקור סרטונים של שעות ואיתור אירועים לפי נקודות זמן מדויקות.

  • אוטומציה של ממשקי משתמש

    זיהוי אלמנטים גרפיים במסכי מחשב ונייד לצורך ביצוע פעולות וקריאה לכלי מערכת כסוכן עצמאי.

  • המרת עיצובים לקוד

    יצירת קוד HTML, CSS ותרשימי Draw.io ישירות מצילומי מסך או שרטוטים ויזואליים.

  • חילוץ טקסט ממסמכים בעייתיים

    פענוח OCR עמיד בתנאי טשטוש, צילום עקום ומסמכים ארוכים בריבוי שפות.

איפה זה נופל

הכרטיס מדגיש יכולות גבוהות, אבל מודלים מהסוג הזה שמנסים להפעיל ממשקי משתמש נוטים לפספס אלמנטים קטנים או ללחוץ על כפתורים לא נכונים כשהרזולוציה משתנה. חלון ההקשר העצום של 256K מפתה, אך דורש משאבי זיכרון אדירים בפועל, ובאורכים קיצוניים עדיין ייתכנו הזיות או פספוס פרטים בתוך סרטונים ארוכים. תמיכת ה־OCR הורחבה ל־32 שפות, אך רשימת השפות המדויקת לא פורטה בכרטיס, כך שחובה לבדוק איכות זיהוי בעברית לפני שמסתמכים עליו.

אותה משפחה

Qwen3-VL יצא ב־6 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם צריך להוריד את כל 476 הגיגה בייט כדי להשתמש במודל?

לא. המשקל הכולל מייצג 34 קבצים שמכילים רמות כימות שונות של המודל. אתם צריכים להוריד רק את קובץ ה־GGUF שמתאים לכמות הזיכרון שיש לכם במחשב.

מה נותן התיקון של Unsloth שמוזכר בכרטיס?

Unsloth הוסיפו תיקונים לתבנית השיחה של המודל. זה מבטיח שהפרומפטים שכוללים תמונות וטקסט יעברו עיבוד מדויק בלי שגיאות פירסור שפוגעות באיכות התשובות.

איך מריצים

המאגר הזה כולל קובצי GGUF במשקל כולל של 476 גיגה בייט המחולקים ל־34 קבצים, שכוללים מגוון רחב של רמות כימות. כדי להריץ קובץ בודד מתוכם תצטרכו לבחור את הכימות המתאים לזיכרון שלכם. מודל בגודל כזה, גם בכימות של 4 ביט, ידרוש כרטיס מסך חזק מאוד עם לפחות 24 עד 32 גיגה בייט זיכרון וידאו, או חלוקה בין זיכרון המערכת לכרטיס מסך על חשבון מהירות היצירה.

אם אין לכם חומרה ייעודית ברמה הזו, או שאתם צריכים רק בדיקות נקודתיות של תמונות ומסמכים, פנייה ל־API חיצוני תחסוך את כאב הראש של הורדת מאות גיגות והתעסקות בהגדרות מקומיות.

ollama run hf.co/unsloth/Qwen3-VL-30B-A3B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

34 קבצים במאגר, 476 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד והמשקלים, ולשלב אותו במוצרים סגורים בלי לחשוף קוד מקור, בתנאי ששומרים על הודעת זכויות היוצרים המקורית והצהרת הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗