GPT
Q

Qwen2-VL-2B-Instruct-GGUF

קוד פתוח

bartowskiapache-2.02024-12-14

  • gguf
  • multimodal
  • image-text-to-text
  • en
  • endpoints_compatible

גרסת קוונטיזציה של מודל ראייה וטקסט קומפקטי במיוחד, שמאפשרת לנתח תמונות ישירות מקובצי GGUF גם במחשבים אישיים ללא כרטיס מסך מפלצתי.

  • 25.5 GBמשקל הקבצים
  • 15,747הורדות בחודש
  • 37לייקים

מה זה

מדובר במודל ראייה וטקסט שנועד לקבל תמונה וטקסט ולהחזיר תשובה כתובה, מומר לפורמט GGUF בעזרת llama.cpp גרסה b4327. הממיר השתמש בשיטת imatrix כדי למזער את אובדן הדיוק בזמן הדחיסה. הייחוד העיקרי כאן הוא הדרישות הנמוכות. משקל הקבצים נע בין 0.60GB לגרסה הדחוסה ביותר ועד 3.09GB לגרסת f16 המלאה, כך שכל המשקלים נכנסים בקלות לתוך זיכרון עבודה פשוט.

המודל כולל מגוון גרסאות קוונטיזציה, החל מ־Q2 ועד Q8. חלק מהגרסאות משתמשות ברמת דחיסה Q8_0 לשכבות הקלט והפלט כדי לשמור על יציבות התשובות למרות כיווץ יתר השכבות.

מתאים ל

  • תיאור תמונות מהיר מקומית

    קובץ Q4 שוקל פחות מג'יגה ומאפשר תיוג תמונות אוטומטי במכשיר קצה ללא שליחת מידע לרשת.

  • הרצה מקומית על שבבי ARM

    גרסאות Q4_0 ו־IQ4_NL מבצעות סידור זיכרון מותאם ל־ARM תוך כדי ריצה לקבלת ביצועים מהירים.

  • שילוב בשרתי AVX2

    מאפשר לעבד מאות טוקנים לשנייה מקלט תמונה וטקסט ישירות על גבי מעבד שרת ללא GPU ייעודי.

איפה זה נופל

גודל של שני מיליארד פרמטרים מגביל מאוד את עומק ההבנה. גרסאות קטנות מ־Q4, כמו IQ2 או Q3_K_S, מוגדרות במפורש כבעלות איכות נמוכה או פגיעה בביצועים. בנוסף, המודל הוכשר על אנגלית בלבד לפי נתוני המקור, כך שאין לצפות לזיהוי טקסט מדויק בעברית מתוך תמונות. חשוב גם לזכור שפורמט I-quant לא עובד מול מאיצי Vulkan.

אותה משפחה

Qwen2-VL יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד לשימוש כללי?

הקובץ המומלץ לרוב השימושים הוא Q4_K_M בגודל 0.99GB, ששומר על איכות טובה מול משקל נמוך. אם יש לכם מעט יותר מקום בזיכרון, אפשר לבחור ב־Q6_K_L או Q5_K_M לקבלת דיוק גבוה יותר.

האם המודל ירוץ מהר על מחשב נייד בלי כרטיס מסך של אנבידיה?

כן. הקבצים בגודל הזה עולים בקלות לתוך זיכרון ה־RAM של המחשב, ומעבדים מודרניים מסוגלים להריץ אותם במהירות סבירה מאוד בלי צורך בכרטיס מסך ייעודי.

איך מריצים

כדי להריץ אותו צריך גרסה מקומית מעודכנת של llama.cpp שכוללת את הבינארי llama-qwen2vl-cli. הפקודה דורשת העברת קובץ המודל לצד קובץ ההקרנה הוויזואלית mmproj, תמונה וטקסט.

מבחינת חומרה, קובץ כמו Q4_K_M שוקל 0.99GB ורץ בקלות על מעבד רגיל או על כרטיס מסך פשוט עם פחות מ־4GB של זיכרון גרפי. במידה ואתם עובדים על מעבדי ARM או מעבדים שתומכים ב־AVX, קובץ Q4_0 תומך באריזה מחדש בזמן אמת שמאיצה את העבודה. אם אתם על מעבדי שרת חזקים, בדיקות של Q4_0_8_8 מציגות עד 320 טוקנים לשנייה בעיבוד קלט.

ollama run hf.co/bartowski/Qwen2-VL-2B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. הרישיון מאפשר שימוש מסחרי, שינוי קוד, והפצה חופשית של התוכנה בתוך מוצרים פרטיים או מסחריים, בתנאי שמצרפים עותק של הרישיון המקורי וציון זכויות היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗