GPT
Q

Qwen2.5-VL-7B-Instruct-GGUF

קוד פתוח

unslothapache-2.02025-05-11

  • transformers
  • gguf
  • qwen2_5_vl
  • image-text-to-text
  • multimodal

גרסת קוויזציה בפורמט GGUF למודל ראייה שפה בגודל שבעה מיליארד פרמטרים. הוא מיועד למי שרוצה לעבד תמונות, מסמכים ווידאו ארוך מקומית בלי לשלם על API חיצוני.

  • 128,000טוקנים בהקשר
  • 125 GBמשקל הקבצים
  • 162,381הורדות בחודש
  • 221לייקים

מה זה

מדובר במודל שמשלב הבנת טקסט עם ניתוח ויזואלי של תמונות וסרטונים, באריזה שמתאימה להרצה על מחשב מקומי. השוני המרכזי מול הדור הקודם ומול מודלים מתחרים בגודל שמונה מיליארד פרמטרים הוא היכולת לנתח וידאו של מעל שעה, לאתר רגעים ספציפיים על ציר הזמן ולפלוט קואורדינטות מדויקות במבנה נתונים מסודר.

במבחני ביצועים של מסמכים וגרפים הוא עוקף את קודמו ומתקרב למודלים סגורים, עם ציון של 95.7 במבחן DocVQA לעומת 94.5 בדור הקודם, ועלייה משמעותית בניתוח מתמטי ויזואלי מציון 58.2 לציון 68.2 ב־MathVista. בנוסף, הוא מספק יכולת זיהוי מיקום של כפתורים ואלמנטים במסכים, מה שמאפשר להפעיל אותו כסוכן ויזואלי לאוטומציה של ממשקים.

מתאים ל

  • חילוץ מידע מחשבוניות וטפסים

    הוא מגיע לציון 95.7 ב־DocVQA ויודע להחזיר מידע מובנה ב־JSON מתוך סריקות וטבלאות.

  • איתור קטעים בווידאו ארוך

    המבנה שלו תומך בווידאו מעל שעה ומסוגל להצביע על נקודת הזמן שבה התרחש אירוע מסוים.

  • זיהוי אלמנטים בממשקי משתמש

    הוא מספק קואורדינטות וקופסאות תוחמות לאייקונים וטקסטים על מסכי מחשב ומובייל.

איפה זה נופל

הכרטיס מודה במפורש ששימוש בהרחבת הקשר מעבר ל־32,768 טוקנים באמצעות שיטת YaRN פוגע ישירות בדיוק של משימות איתור במרחב ובזמן, ולכן המפתחים ממליצים שלא להפעיל אותה אם אתם צריכים קואורדינטות מדויקות. בנוסף, השליטה שלו בממשקי טלפון מורכבים עדיין נמוכה, עם ציון של 25.5 בלבד במבחן AndroidWorld ורק 29 אחוז ב־ScreenSpot Pro, כך שהוא ייכשל במשימות אוטומציה מורכבות.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב בלי כרטיס מסך חזק?

אפשר להריץ את גרסאות ה־GGUF המכווצות על מעבד וזיכרון RAM רגיל, אבל ניתוח וידאו ועיבוד תמונות ברזולוציה גבוהה יהיו אטיים מאוד בלי מאיץ גרפי ייעודי.

איך שולטים על צריכת הזיכרון בעבודה עם תמונות?

מגדירים את הפרמטרים min_pixels ו־max_pixels בטעינת המעבד, כדי לחתוך את כמות הטוקנים שהתמונה מייצרת בין 256 ל־1280 טוקנים.

איך מריצים

הריפו הספציפי הזה של unsloth כולל קובצי GGUF במשקל כולל של 125 גיגה בייט המחולקים בין דרגות דחיסה שונות, ומיועד לטעינה דרך ספריות כמו llama.cpp או סביבות תואמות. כדי להריץ גרסה מכווצת של 7B תצטרכו כרטיס מסך עם לפחות שמונה עד שישה עשר גיגה בייט זיכרון, תלוי במידת הקוונטיזציה ובאורך ההקשר שתדרשו.

אם אתם מתכננים לנתח בעיקר סרטונים של שעה או מסמכים ברזולוציה מקסימלית בלי כרטיס מסך ייעודי, עדיף להשתמש ב־API מרוחק. המודל דורש התקנה ישירה מהקוד של transformers וספריית עזר ייעודית בשם qwen-vl-utils כדי לטפל בקובצי וידאו מקומיים.

ollama run hf.co/unsloth/Qwen2.5-VL-7B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות את הקוד ולהפיץ אותו בתוך מוצרים סגורים, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי בקוד המקור.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗