GPT
Q

Qwen2-VL-7B-Instruct-GGUF

קוד פתוח

bartowskiapache-2.02024-12-14

  • gguf
  • multimodal
  • image-text-to-text
  • en
  • endpoints_compatible

גרסת GGUF של מודל ראייה ושפה בגודל שבעה מיליארד פרמטרים. היא מאפשרת להריץ עיבוד תמונה וטקסט מקומית דרך llama.cpp, בלי לשלוח שום מידע לשרת חיצוני.

  • 108 GBמשקל הקבצים
  • 7,760הורדות בחודש
  • 43לייקים

מה זה

המאגר הזה מכיל קובצי כיול וכימות של Qwen2-VL-7B שנוצרו באמצעות imatrix. המודל מתמחה בהבנת תמונות לצד טקסט, ומחזיר תיאורים, זיהוי פרטים או מענה לשאלות על מסמכים וצילומים. בגלל שמדובר במודל ראייה, הוא כולל רכיב הקרנה ייעודי לעיבוד הוויזואלי בנוסף למשקולות השפה הרגילות.

במקום לקחת את גרסת הדיוק המלאה ששוקלת 15.24GB, המאגר פורס מבחר שנע בין 15.24GB לגרסאות מכווצות של 2.78GB. משתמשים עם כרטיסי מסך צנועים יכולים לטעון אותו ישירות לזיכרון הקיים, כאשר רמות הדחיסה הבינוניות שומרות על רמת ביצועים טובה יחסית לגודל.

מתאים ל

  • ניתוח תמונות מקומי

    מאפשר לשלוף מידע מתמונות ומסמכים סרוקים בלי להוציא נתונים רגישים מהרשת המקומית.

  • הרצה על חומרת קצה

    משקל קובץ של פחות מחמישה גיגה בגרסת Q4_K_M נכנס בקלות למחשבים אישיים עם כרטיס מסך פשוט.

  • בדיקות ופיתוח מודלי ראייה

    נותן סביבת ניסוי נוחה לפיתוח ממשקים מבוססי תמונה דרך llama.cpp.

איפה זה נופל

המודל מתועד רשמית באנגלית בלבד. מי שבונה עליו להבנת תמונות עם טקסט עברי או לשאלות בעברית עלול להיתקל בהזיות או בחוסר תגובה. בנוסף, גרסאות הכימות הנמוכות מאוד, למשל Q2_K או IQ2_M, מאבדות דיוק משמעותי בניתוח פרטים קטנים בתמונה. הרצת ראייה ממוחשבת ב־GGUF דורשת גם בינארי תואם וטעינת קובץ הקרנה נפרד, מה שמסבך את האינטגרציה יחסית למודלי טקסט בלבד.

אותה משפחה

Qwen2-VL יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ כדאי להוריד לשימוש רגיל?

הקובץ המומלץ לרוב השימושים הוא Q4_K_M ששוקל 4.68GB ומציע שיווי משקל מצוין בין גודל לאיכות פלט. אם יש לכם פחות מ־6GB זיכרון כרטיס מסך, אפשר לרדת לגרסאות ה־IQ כמו IQ4_XS.

למה חובה להוריד גם קובץ mmproj?

מודלים של ראייה מורכבים משני חלקים: מפענח השפה והמקודד שמתרגם את הפיקסלים לטוקנים שהמודל מבין. קובץ ה־mmproj מכיל את משקולות התמונה, ובלעדיו המודל לא יצליח לקרוא את הקלט הוויזואלי.

האם המודל ירוץ מהר על מעבד בלי כרטיס מסך?

הוא יעבוד על מעבדי ARM ו־AVX הודות לאופטימיזציות בגרסאות ה־Q4_0, אבל זמני עיבוד התמונה והתשובה יהיו איטיים משמעותית בהשוואה להרצה מלאה בתוך כרטיס מסך.

איך מריצים

כדי להריץ אותו צריך גרסה עדכנית של llama.cpp שתומכת במודלים מסוג זה, ולספק לו שני קבצים במקביל: קובץ המודל עצמו וקובץ ה־mmproj שמטפל בעיבוד התמונה. ההרצה נעשית בפקודה ייעודית כמו llama-qwen2vl-cli עם נתיב לתמונה ופרומפט מוגדר.

מבחינת חומרה, קובץ כמו Q4_K_M דורש 4.68GB וירוץ בנוחות על כרטיס מסך עם 6GB או 8GB של זיכרון ייעודי. הגרסאות הקטנות יותר, כמו סדרת ה־IQ שיורדת מתחת ל־4GB, מתאימות גם למעבדים רגילים, אך מי שצריך מהירות גבוהה לניתוח שוטף יעדיף כרטיס גרפי מלא.

ollama run hf.co/bartowski/Qwen2-VL-7B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מפורסם תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקבצים והפצה שלהם בתוך מוצרים סגורים. התנאים המרכזיים הם שמירה על הצהרת זכויות היוצרים המקורית וצירוף עותק של הרישיון עצמו בכל הפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗