GPT
Q

Qwen2.5-VL-32B-Instruct-AWQ

קוד פתוח

Qwenapache-2.02025-03-26

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • multimodal

יש כאן גם סקירה על Qwen עצמו.

גרסה מכווצת של מודל ראייה ושפה חזק, שמתאימה למי שחייב דיוק גבוה בניתוח מסמכים או וידאו אבל מוגבל בחומרת השרת. הקוונטיזציה חותכת את המשקל בלי להקריב כמעט יכולות.

  • 33Bפרמטרים
  • 128,000טוקנים בהקשר
  • 19.3 GBמשקל הקבצים
  • 1,679,913הורדות בחודש

מה זה

מדובר במודל שמשלב הבנת תמונה, טקסט ווידאו ארוך עם דגש על יכולות תפעול ממשקים ומענה מובנה בפורמט JSON. הוא מזהה אלמנטים גרפיים, מחזיר נקודות ציון וקואורדינטות של אובייקטים, ומסוגל לאתר אירועים ספציפיים לאורך שעות של וידאו באמצעות דגימת פריימים דינמית.

גרסת ה־AWQ המכווצת שומרת על ביצועים שקרובים מאוד למקור הלא מכווץ. במבחן הבנת המסמכים DocVQA היא מגיעה לציון 94.1489 לעומת 93.9107 במודל המלא, ובמבחן המתמטיקה החזותית MathVista היא מאבדת קצת יותר מנקודה אחת בלבד, מ־74.7 ל־73.6. ההבדל המשמעותי ביותר מופיע ב־MMMU הכללי, שם הציון יורד מ־70.0 ל־67.8, שזה מחיר סביר מאוד בשביל לחסוך משאבי זיכרון יקרים.

מתאים ל

  • חילוץ מידע מחשבוניות וטפסים

    שומר על ציון גבוה של 94.1489 ב־DocVQA ופולט שדות וערכים ישירות לתוך מבנה JSON.

  • איתור קטעים בווידאו ארוך

    יודע לנתח סרטונים של מעל שעה ולהצביע על נקודת הזמן המדויקת שבה התרחש אירוע.

  • סוכן חזותי להפעלת ממשקים

    מייצר תיבות תוחמות וקואורדינטות מסך מדויקות להפעלת מחשב או טלפון על גבי כרטיס בודד.

איפה זה נופל

למרות שהארכיטקטורה תומכת בחלון גדול, הקובץ מוגדר במקור לעד 32,768 טוקנים. הרחבה שלו באמצעות מנגנון YaRN פוגעת באופן ישיר ביכולת של המודל למקם אובייקטים במרחב התמונה ולזהות נקודות זמן מדויקות בווידאו, והיוצרים עצמם לא ממליצים על זה.

בנוסף, עיבוד וידאו דורש קבצים מקומיים בלבד ולא מקבל קישורי רשת ישירים. ספריית הטעינה decord שמומלצת לביצועים לא נתמכת רשמית בכל מערכות ההפעלה ודורשת קימפול ידני מחוץ ללינוקס, מה שמסבך את סביבת הפיתוח המקומית.

אותה משפחה

Qwen2.5-VL יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב מקומי בלי שרת?

כן, בזכות משקל של 19.3 ג'יגה בייט אפשר להעלות אותו על כרטיס מסך ביתי חזק של 24 ג'יגה בייט. קחו בחשבון שאם תעלו רזולוציית תמונה גבוהה או טקסטים ארוכים במיוחד, צריכת הזיכרון תקפוץ מעבר למגבלה.

כמה ביצועים מאבדים בגלל כיווץ ה־AWQ?

מעט מאוד. בבדיקות מסמכים הוא מציג ביצועים זהים למודל המלא, ורק במבחני ידע כללי מורכבים כמו MMMU יש ירידה קלה של קצת יותר משתי נקודות.

איך מריצים

משקל הקבצים עומד על 19.3 ג'יגה בייט, כך שאפשר להעלות אותו על כרטיס מסך בודד של 24 ג'יגה בייט כמו RTX 3090 או 4090, בתנאי שלא דוחפים חלון הקשר עצום בבת אחת. הרצה מתבצעת ישירות דרך ספריית transformers, אך יש צורך להתקין את גרסת הפיתוח של הספרייה מ־GitHub כדי למנוע שגיאות זיהוי של הארכיטקטורה, יחד עם חבילת העזר qwen-vl-utils לטיפול במדיה.

אם אתם מתכננים לעבד וידאו ארוך או אלפי מסמכים ברצף ואין לכם שרת ייעודי שפועל מסביב לשעון, החזקת המודל בחשבון ענן מקומי תהיה יקרה ומסורבלת לעומת קריאה ל־API חיצוני.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/Qwen2.5-VL-32B-Instruct-AWQ")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים פנימיים או שירותים ללקוחות, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗