GPT
Q

QVQ-72B-Preview

קוד פתוח

Qwenother2024-12-24

  • transformers
  • safetensors
  • qwen2_vl
  • image-text-to-text
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסת מחקר של מודל ראייה שמיועדת להסקה לוגית ומתמטית מורכבת מתוך תמונות. הוא נותן פייט למודלים סגורים מובילים במבחני חשיבה, אבל דורש תשתיות כבדות של שרת ייעודי.

  • 73Bפרמטרים
  • 128,000טוקנים בהקשר
  • 137 GBמשקל הקבצים
  • 956הורדות בחודש

מה זה

מדובר במודל ראייה ושפה מבוסס ארכיטקטורת Qwen2-VL, שמכוון ישירות לפתרון בעיות חשיבה ויזואליות ולא רק לתיאור תמונות. במבחנים כמו MathVista הוא מגיע לתוצאה של 71.4, שמשתווה ואף עוקפת מודלים קנייניים כבדים כמו o1 או Claude 3.5 Sonnet. גם במבחן MathVision הוא מציג 35.9 אחוזים, שזה זינוק ברור לעומת מודל הבסיס הקודם שלהם.

המשמעות היא יכולת ניתוח של תרשימים מורכבים, גרפים ומשוואות ויזואליות ברמה שלא נראתה עד כה במשקלים פתוחים. הוא בנוי לחשיבה רב שלבית עמוקה מול קלט ויזואלי, אך מוגדר רשמית כדגם ניסיוני שמיועד למחקר.

מתאים ל

  • ניתוח בעיות מתמטיות מתמונה

    הוא מצטיין במבחני MathVista ומתאים לפיצוח תרשימים וגרפים מורכבים.

  • הסקה לוגית מתרשימים מדעיים

    ציון של 70.3 במבחן MMMU הופך אותו למועמד חזק לפענוח דיאגרמות רב תחומיות.

  • מחקר על תהליכי חשיבה ויזואליים

    הוא מאפשר לבחון איך מודל ראייה פתוח מפרק בעיה מורכבת שלב אחר שלב.

איפה זה נופל

זהו דגם תצוגה מקדימה עם בעיות יציבות מוצהרות. הוא תומך כרגע בשיחה של סבב אחד בלבד, לא מקבל וידאו, ונוטה להיכנס ללולאות חשיבה אינסופיות שמנפחות את הפלט בלי להגיע לתשובה. בריבוי שלבי חשיבה הוא מאבד לעיתים פוקוס מהתמונה וממציא עובדות, ואין לו שום יתרון בזיהוי עצמים פשוט כמו חיות או אנשים. בנוסף, הוא נוטה לערבב שפות באמצע התשובה.

שאלות
נפוצות

האם המודל מתאים לפיתוח צ'אטבוט שירותי מרובה שלבים?

לא. המודל מוגבל כרגע לסבב שיחה בודד ואינו תומך בהיסטוריית שיחה. בנוסף, הוא נוטה לפעמים לערבב שפות ולהיכנס ללולאות ניסוח ארוכות.

האם הוא מזהה אנשים ועצמים טוב יותר מגרסת ה־VL הרגילה?

לא, המפתחים מבהירים שאין בו שיפור במשימות זיהוי בסיסיות. היתרון שלו מתמצה בהסקה לוגית ופתרון בעיות מתמטיות, ולא באחיזת עיניים של זיהוי פריטים.

איך מריצים

כדי להריץ אותו מקומית בפורמט bfloat16 מלא, תצטרכו לפחות שני כרטיסי A100 או H100 של 80GB, שכן המשקולות לבדן תופסות 137 ג'יגה בייט זיכרון לפני חישובי הקשר. המודל עובד דרך ספריית transformers ונעזר בחבילת qwen-vl-utils לטעינת תמונות.

אם אין לכם קלאסטר כזה זמין בענן, להרים אותו עצמאית זה מהלך יקר ומסורבל. לרוב צוותי הפיתוח יהיה זול והגיוני בהרבה לבדוק אותו דרך ממשק הצ'אט של Qwen או להמתין לזמינות שלו כנקודת קצה מנוהלת.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="Qwen/QVQ-72B-Preview")
print(pipe("שלום"))

הקבצים

50 קבצים במאגר, 137 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ולא מצוין רישיון קוד פתוח מוכר. המשמעות היא שאין אישור מפורש לשימוש מסחרי חופשי, ובגלל שמדובר במודל מחקרי מוגדר, חובה לבדוק את תנאי השימוש המשפטיים של עליבאבא לפני שמשלבים אותו במערכת ייצור כלשהי.

הרישיון המלא בעמוד המודל ↗