GPT
Q

Qwen2.5-VL-3B-Instruct-AWQ

קוד פתוח

Qwenרישיון לא דווח2025-02-13

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • multimodal

יש כאן גם סקירה על Qwen עצמו.

גרסה מכווצת בארכיטקטורת ראייה ושפה ששוקלת 3.2 גיגה בלבד. אתם מריצים מודל שמנתח תמונות ווידאו ישירות על כרטיס מסך ביתי צנוע בלי לשלם על שירותי ענן.

  • 3.8Bפרמטרים
  • 128,000טוקנים בהקשר
  • 3.2 GBמשקל הקבצים
  • 337,560הורדות בחודש

מה זה

המודל מעבד קלט משולב של תמונה, וידאו וטקסט ומחזיר טקסט. הוא בנוי לעבוד כסוכן ויזואלי שמסוגל לזהות אלמנטים בממשקי מחשב וטלפון, לאתר אובייקטים בתמונות בעזרת נקודות או תיבות גבול, ולנתח מסמכים כמו חשבוניות וטבלאות ישירות למבנה נתונים. בנוסף, הוא מתמודד עם סרטונים של מעל שעה ומסוגל להצביע על נקודת הזמן שבה התרחש אירוע מסוים.

גרסת הקיצוץ הזו, המבוססת על אלגוריתם AWQ, נועדה לשמור על ביצועים תחת מגבלות זיכרון. במבחני ההשוואה רואים ירידה מתונה ביחס למשקל המלא. בבדיקת מסמכים הציון יורד מ־93.0 ל־91.8, במשימות היגיון רב-תחומי מ־51.7 ל־49.1, ובמתמטיקה חזותית מ־61.4 ל־58.8. אלה פשרות סבירות מאוד בהתחשב בעובדה שהמשקל יורד לרמה שמאפשרת הרצה חלקה במכשיר קצה.

מתאים ל

  • סריקת קבלות וחשבוניות

    מחלץ נתונים מטבלאות וטפסים ומחזיר אותם כטקסט מובנה ישירות על המחשב המקומי.

  • איתור קטעים בווידאו

    מזהה אירועים ספציפיים לאורך שעות צילום ומציין את חותמת הזמן שבה הם קרו.

  • אוטומציה בממשקי משתמש

    מזהה כפתורים ואייקונים במסך ומחזיר נקודות ציון לפעולה עבור סוכני תוכנה.

איפה זה נופל

המודל הזה מוגדר רשמית לשפה האנגלית בלבד, ולכן לא הייתי מסתמך עליו לחילוץ טקסט מעוות או מסמכים מורכבים בעברית. בנוסף, אף על פי שאפשר להרחיב את ההקשר מעבר ל־32,768 טוקנים בעזרת שיטת YaRN, המפתחים מזהירים במפורש שהדבר פוגע משמעותית ביכולת המודל לאתר מיקומים במרחב ובזמן. הירידה של נקודות בודדות בכל מבחני הביצועים מורגשת בעיקר במשימות חישוב עדינות שבהן כל אובדן דיוק מייצר הזיות.

אותה משפחה

Qwen2.5-VL יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב בלי כרטיס מסך של אנבידיה?

הספרייה דורשת רכיבי עיבוד ספציפיים לטעינת וידאו והרחבת זיכרון, וקוד הדוגמה מבוסס על סביבת לינוקס. על מעבד רגיל תקבלו זמני מענה ארוכים מאוד, וטעינת וידאו עשויה לדרוש הידור ידני של ספריות עזר.

איך שולטים בצריכת הזיכרון בעבודה עם תמונות גדולות?

אפשר להגדיר מראש את כמות הפיקסלים המינימלית והמקסימלית בעזרת המעבד של המודל. הגבלת כמות הפיקסלים מונעת יצירת עודף טוקנים וחוסכת בזיכרון בזמן הניתוח.

איך מריצים

כדי להריץ אותו צריך להתקין את transformers ישירות ממאגר הגיטהאב כדי למנוע שגיאות טעינה, לצד ספריית qwen-vl-utils. משקל הקבצים עומד על 3.2 גיגה בלבד, כך שכרטיס מסך עם 6 עד 8 גיגה זיכרון יספיק לעבודה שוטפת עם תמונות ברזולוציה רגילה.

אם אתם מתכננים להזין סרטונים ארוכים במיוחד או להרחיב את חלון ההקשר מעבר לברירת המחדל של 32 אלף טוקנים, תצטרכו כרטיס חזק יותר. אם העומס שלכם מורכב מאלפי קריאות מזדמנות ביום, אחזקת מכונה ייעודית תעלה לכם יותר מאשר פנייה ישירה לנקודת קצה מנוהלת.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen2.5-VL-3B-Instruct-AWQ")
print(pipe("שלום"))

הרישיון

המודל מסומן תחת רישיון מחקרי של המפתח בשם qwen-research, אך בעמוד הראשי לא דווח רישיון פתוח מוכר. המשמעות המעשית היא שאין כאן היתר שימוש מסחרי חופשי, ואתם לא יכולים להטמיע אותו במוצר שמניב הכנסות בלי לבדוק ולקבל אישור מפורש לפי תנאי ההסכם של היוצרים.

הרישיון המלא בעמוד המודל ↗