GPT
Q

Qwen3-VL-30B-A3B-Instruct-AWQ

קוד פתוח

QuantTrioapache-2.02025-10-04

  • transformers
  • safetensors
  • qwen3_vl_moe
  • image-text-to-text
  • AWQ

גרסה מכווצת בקוונטיזציית AWQ של מודל ראייה ושפה מבוסס תערובת מומחים. היא שוקלת 16.7 גיגה ומציעה חלון הקשר ענק לצד יכולות פענוח תמונה ווידאו.

  • 31Bפרמטרים
  • 262,144טוקנים בהקשר
  • 16.7 GBמשקל הקבצים
  • 1,440,615הורדות בחודש

מה זה

מדובר בגרסת AWQ של מודל ראייה ושפה הכולל 31 מיליארד פרמטרים בארכיטקטורת תערובת מומחים. הוא משלב עיבוד תמונה וטקסט ומיועד לפענוח מסמכים מורכבים, ניתוח וידאו ארוך והבנה מרחבית דו ממדית ותלת ממדית. המבנה מפעיל רק חלק מהפרמטרים בכל שלב, מה שמאפשר להריץ אותו בקצב מהיר יותר ביחס למודלים צפופים באותו גודל.

המודל כולל תמיכה בראיית ממשקי משתמש, יצירת קוד HTML או דיאגרמות מתוך צילומי מסך, וזיהוי טקסט בתוך תמונות עבור 32 שפות. ארכיטקטורת המיקום שבו מותאמת למעקב אחרי עצמים ואירועים לאורך זמן בווידאו, לצד דיוק בחיבור בין פרטי תמונה לתוויות טקסט. חלון ההקשר המלא מגיע ל־262,144 טוקנים, מה שמאפשר להזין שעות של וידאו או מאות עמודי מסמכים בבת אחת.

מתאים ל

  • קריאת מסמכים סרוקים

    פענוח תמונות של טפסים ומסמכים מורכבים עם מנוע OCR שתומך בטקסט מסובב ותאורה לקויה.

  • תחקור וידאו ממושך

    איתור אירועים לפי חותמות זמן בסרטונים ארוכים באמצעות חלון הקשר ענק.

  • סוכן ממשק משתמש

    זיהוי רכיבי כפתורים ומבנה במסכי מחשב וטלפון לצורך ביצוע פעולות אוטומטיות.

  • המקת תמונה לקוד

    הפיכת צילומי מסך ושרטוטים לקוד תצוגה כמו HTML או דיאגרמות Draw.io.

איפה זה נופל

חלון ההקשר המלא תומך ב־262,144 טוקנים, אבל בפועל הרצת עומס כזה דורשת כמות זיכרון עצומה שלא תעבוד עם שרת ביתי רגיל. קוונטיזציה של מודלי ראייה עלולה לפגוע בזיהוי פרטים זעירים מאוד בתמונות מטושטשות או בעלות ניגודיות נמוכה.

כרטיס המודל לא מפרט אילו שפות נתמכות מתוך 32 השפות של מנוע הראייה, ולכן צריך לבדוק היטב את היכולת שלו לקרוא מסמכים בעברית. בנוסף, מנגנוני תערובת מומחים רגישים לניהול הזיכרון בזמן הפעלת סוכני ממשק אוטונומיים.

שאלות
נפוצות

האם המודל ירוץ על כרטיס מסך ביתי יחיד של 24 גיגה?

המודל תופס כ־17 גיגה זיכרון נטו, כך שתיאורטית הוא נכנס לכרטיס כזה. הבעיה מתחילה בחישובי ההקשר והתמונות, שדורשים זיכרון עבודה נוסף. היצרן מגדיר מראש חלוקה לשני כרטיסים כדי לאפשר הרצה יציבה.

האם הוא מסוגל לחלץ טקסט מעברית סרוקה?

כרטיס המודל מציין תמיכה ב־32 שפות עבור OCR אך לא מפרט את רשימת השפות המדויקת. אם אתם מתכננים לעבד מסמכים בעברית, חובה לבצע בדיקה ישירה על דוגמאות שלכם לפני הטמעה במערכת.

איך מריצים

המשקל הכולל יושב על 16.7 גיגה ב־19 קבצים, הודות לקוונטיזציית AWQ. כדי להריץ אותו בהיסק מקומי מומלץ להשתמש ב־vLLM עם שני מעבדים גרפיים, כפי שמציגות הגדרות היצרן שדורשות פיצול לשני כרטיסים. כרטיס בודד של 24 גיגה זיכרון יתקשה להחזיק את המודל יחד עם חלון הקשר ארוך.

בהוראות ההרצה מגבילים מראש את האורך ל־32,768 טוקנים כדי לשמור על יציבות הזיכרון. אם אתם זקוקים לניתוח נקודתי של תמונות בודדות ולא מחזיקים מערך שרתים ייעודי, עדיף לפנות ל־API חיצוני במקום להחזיק שרת כפול כרטיסים דולק ברקע.

from transformers import pipeline

pipe = pipeline("text-generation", model="QuantTrio/Qwen3-VL-30B-A3B-Instruct-AWQ")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו במוצר שלכם, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗