GPT
Q

QVQ-72B-Preview-GGUF

קוד פתוח

bartowskiother2024-12-24

  • gguf
  • chat
  • image-text-to-text
  • en
  • endpoints_compatible

גרסת GGUF מכווצת למודל ראייה ושפה של 72 מיליארד פרמטרים. היא נועדה למי שרוצה לנתח תמונות באופן מקומי על חומרה קיימת בלי לשלוח מידע החוצה.

  • 958 GBמשקל הקבצים
  • 1,591הורדות בחודש
  • 55לייקים

מה זה

המאגר הזה מציע המרות imatrix של מודל QVQ-72B-Preview לפורמט GGUF, שנוצרו באמצעות llama.cpp בגרסה b4381 על בסיס מודל המקור של Qwen. מדובר במודל שמשלב קלט של תמונה וטקסט ומחזיר טקסט באנגלית, ומיועד להסקת מסקנות ויזואלית מורכבת.

bartowski מספק כאן מגוון רחב של רמות כיול ודחיסה, החל מגרסאות קיצוניות באיכות נמוכה כמו IQ1_M ועד לגרסאות כבדות כמו Q8_0. המבחר הזה נועד לאפשר התאמה מדויקת בין גודל הקובץ לבין כמות הזיכרון הזמינה במחשב שלכם, במיוחד אם אתם רוצים לשמור על שכבות הפלט וההטמעה באיכות גבוהה של Q8_0 כפי שנעשה בחלק מגרסאות ה־K.

מתאים ל

  • ניתוח תמונות מקומי

    מאפשר לעבד תמונות לצד הנחיות טקסט מקומית בלי תלות ברשת חיצונית.

  • בדיקת הסקת מסקנות ויזואלית

    מתאים לניסוי ביכולות פענוח מורכבות של מודל ראייה גדול בגודל 72B.

  • פריסה בסביבות זיכרון מוגבל

    גרסאות ה־IQ מאפשרות דחיסה קיצונית עד 23.74GB כשאין מספיק חומרה.

איפה זה נופל

המודל מוגדר כגרסת תצוגה מקדימה, כך שלא מדובר במוצר מוגמר ויציב. הגרסאות הקטנות ביותר, כמו IQ1_M או Q3_K_S, מתוארות ישירות כבעלות איכות נמוכה מאוד ולא מומלצות לעבודה שדורשת דיוק. בנוסף, קובצי I-quant אינם נתמכים ב־Vulcan, ומעבדי ARM או מעבדים עם פקודות AVX מציגים תנודות ביצועים תלויות ארכיטקטורה שמחייבות בדיקה לפני שילוב במערכת.

שאלות
נפוצות

באיזה קובץ כדאי לבחור להתקנה ראשונית?

עבור רוב המקרים bartowski ממליץ על Q4_K_M ששוקל 47.42GB ומציע איזון טוב בין איכות למקום. אם החומרה שלכם מוגבלת יותר, אפשר לרדת ל־IQ4_XS או לגרסאות ה־3 ביט.

האם אפשר להריץ אותו ישירות ב־llama.cpp הרגיל?

המודל דורש שימוש בפקודה הספציפית llama-qwen2vl-cli יחד עם קובץ ה־mmproj התואם. הרצה ללא מודל הפרויקציה הנלווה והכלי הייעודי לא תאפשר עיבוד של התמונות.

האם גרסאות ה־IQ יעבדו על כל כרטיס גרפי?

גרסאות אלו עובדות טוב עם cuBLAS של Nvidia ועם rocBLAS של AMD, וכן על מעבדים ו־Apple Metal במחיר של איטיות. הן אינן תואמות לעבודה מול Vulcan.

איך מריצים

כדי להריץ אותו בפועל צריך להשתמש בכלי llama-qwen2vl-cli יחד עם קובץ מודל הפרויקציה mmproj-QVQ-72B-Preview-f16.gguf. גרסת ברירת המחדל המומלצת לרוב השימושים היא Q4_K_M ששוקלת 47.42GB, מה שאומר שאתם חייבים לפחות נפח זיכרון כזה ב־VRAM אם אתם רוצים ביצועים מהירים, או שילוב של זיכרון מערכת וכרטיס מסך תוך פשרה על מהירות התגובה.

אם יש לכם פחות מזה, קיימות גרסאות IQ שחוסכות מקום עד לנפח של 23.74GB ב־IQ1_M, אבל הן מגיעות עם פגיעה מורגשת באיכות. מעבר לכך, גרסאות שגדולות מ־50GB מחולקות למספר קבצים ודורשות הורדה מסודרת של כל החלקים.

ollama run hf.co/bartowski/QVQ-72B-Preview-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

36 קבצים במאגר, 958 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח בעמוד המודל מוגדר כ־other ללא פירוט של תנאי השימוש המלאים. מצב כזה אומר שאי אפשר לדעת מראש אם מותר להשתמש בו במוצר מסחרי, וחובה לחזור לדף המודל המקורי של Qwen כדי לבדוק את ההגבלות המשפטיות המדויקות לפני כל שימוש בקוד או בהפצה.

הרישיון המלא בעמוד המודל ↗