GPT
Q

Qwen2.5-VL-72B-Instruct-AWQ

קוד פתוח

Qwenother2025-02-13

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • multimodal

יש כאן גם סקירה על Qwen עצמו.

גרסה מכווצת של מודל הראייה הגדול של Qwen ששוקלת 40.1 גיגה בייט. היא מיועדת למי שרוצה יכולות עיבוד תמונה ווידאו כבדות מקומית בלי לתפוס שני שרתי עיבוד מלאים.

  • 74Bפרמטרים
  • 128,000טוקנים בהקשר
  • 40.1 GBמשקל הקבצים
  • 40,484הורדות בחודש

מה זה

מדובר במודל מולטימודלי של 74 מיליארד פרמטרים שעבר קוונטיזציה בשיטת AWQ כדי לחסוך מקום וזיכרון. המודל מנתח מסמכים סרוקים, גרפים, ממשקי מחשב וטלפון, וסרטוני וידאו של יותר משעה. הוא מייצר נקודות ציון וקופסאות תוחמות לאובייקטים בתמונה ומחזיר אותן במבנה ג'ייסון מסודר.

במבחני הביצועים הירידה מגרסת הבסיס כמעט אפסית. בבדיקת הבנת מסמכים הוא קיבל ציון של 96 לעומת 96.1 במקור, ובמבחן הכללי MMMU הוא יורד מ־70 ל־69.1 בלבד. המודל שומר על יכולת ניתוח חזותי גבוהה מאוד ודיוק כמעט זהה למשקלים המקוריים, במיוחד בקריאת טפסים וחשבוניות באנגלית.

מתאים ל

  • חילוץ מידע מחשבוניות וטפסים

    הוא מגיע לציון 96 במבחני מסמכים ויודע להוציא קואורדינטות ונתונים ישירות למבנה ג'ייסון.

  • איתור קטעים בווידאו ארוך

    מנגנון הזמן שלו מאפשר לתת קובץ של שעה ולמצוא אירועים ספציפיים לפי חותמת זמן.

  • סוכן שמפעיל ממשקי משתמש

    הוא מזהה כפתורים, שדות ואייקונים במסך ומחזיר מיקומים מדויקים ללחיצה.

איפה זה נופל

היוצרים מזהירים מפורשות ששימוש בשיטות להרחבת חלון ההקשר מעבר ל־32,768 טוקנים, כמו YaRN, פוגע בצורה קשה ביכולת של המודל לאתר אובייקטים ואירועים בזמן ובמרחב. בנוסף, עיבוד וידאו דורש ספריית פענוח שלא מותקנת בקלות מחוץ ללינוקס, ותמיכת הווידאו מוגבלת לקבצים מקומיים בלבד ולא לכתובות רשת.

אותה משפחה

Qwen2.5-VL יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב נייד או תחנת עבודה רגילה?

לא. המודל שוקל 40.1 גיגה בייט ודורש כרטיס גרפי ייעודי של 48 גיגה בייט זיכרון לפחות כדי להיטען ולעבוד בלי לקרוס. מחשב רגיל בלי כרטיס שרת ייעודי פשוט לא יעמוד בעומס.

למה לקחת את גרסת ה־AWQ ולא את המקור?

גרסת המקור דורשת פי שניים זיכרון וידאו ויקרה בהרבה להרצה. במבחני הביצועים הפער בדיוק הוא פחות מאחוז ברוב המשימות, כך שזה חוסך משאבי חומרה בלי פגיעה מורגשת בתוצאה.

איך מריצים

המשקל הכולל של הקבצים הוא 40.1 גיגה בייט, כך שתצטרכו שרת עם לפחות 48 עד 80 גיגה בייט זיכרון וידאו כדי לטעון אותו, למשל כרטיס A100 או שני כרטיסי RTX חזקים. ההרצה עצמה דורשת התקנה של transformers ישירות מקוד המקור בגיטהאב כדי למנוע שגיאות של מזהה המודל, יחד עם חבילת העזר הייעודית של Qwen לעיבוד וידאו.

אם אתם לא מחזיקים תשתית ענן פרטית שרצה ברציפות, העלות של החזקת חומרה כזו לא משתלמת. עדיף לקרוא לגרסה הזו דרך ספק צד שלישי שגובה לפי טוקנים, אלא אם אתם חייבים שהווידאו והתמונות שלכם לא ייצאו מהרשת המקומית.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen2.5-VL-72B-Instruct-AWQ")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר תחת תנאי qwen ולא תחת רישיון קוד פתוח סטנדרטי כמו אפאצ'י או MIT. הקישור מוביל לקובץ תנאים פרטי של החברה, ולכן לפני הטמעה במוצר מסחרי צריך לקרוא את המסמך המדויק ולוודא שאין בו הגבלות על היקף משתמשים חודשי או דרישה לאישור מיוחד.

הרישיון המלא בעמוד המודל ↗