GPT
Q

Qwen2.5-VL-7B-Instruct-unsloth-bnb-4bit

קוד פתוח

unslothapache-2.02025-01-31

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • multimodal

גרסה מכווצת בכימות 4 ביט של מודל הראייה והשפה מסדרת Qwen2.5. היא מאפשרת להריץ ניתוח תמונות ווידאו ישירות על חומרה ביתית במקום לשלם לפי קריאה לספק חיצוני.

  • 8.5Bפרמטרים
  • 32,768טוקנים בהקשר
  • 6.4 GBמשקל הקבצים
  • 6,817הורדות בחודש

מה זה

המודל הזה מטפל בטקסט, תמונות ווידאו ביחד. בגודל של 8.5 מיליארד פרמטרים הוא מביא ביצועים חריגים בניתוח מסמכים, טבלאות וגרפים. במבחן DocVQA הוא מקבל 95.7 ובמבחן OCRBench הוא מגיע לציון של 864, תוצאות שמציבות אותו מעל מודלים מתחרים בגודל דומה ואף עוקפות שירותים קנייניים כמו GPT-4o-mini בחלק מהמשימות הוויזואליות.

בנוסף לניתוח סטטי, הוכנסו כאן יכולות זיהוי מיקום של אובייקטים בתוך התמונה, פליטת קואורדינטות בפורמט JSON, וטיפול בווידאו באורך של מעל שעה. הוא תומך בהפעלת כלים ובשליטה בממשקים גרפיים כמו טלפונים ומחשבים, עם דיוק של 93.7 במשימות פשוטות של שליטה באנדרואיד.

מתאים ל

  • חילוץ נתונים מחשבוניות

    ניתוח סריקות של טפסים, קבלות וטבלאות והמרת המידע למבנה JSON מסודר.

  • איתור רגעים בווידאו

    סריקת קובצי וידאו ארוכים וציון חותמות זמן מדויקות שבהן מתרחשים אירועים מסוימים.

  • זיהוי אלמנטים במסך

    זיהוי כפתורים ואייקונים באפליקציות מובייל והחזרת קואורדינטות להפעלת אוטומציות.

איפה זה נופל

המודל מוגדר רשמית רק באנגלית, כך שקריאת טקסטים או מסמכים בעברית עלולה להיכשל לחלוטין או לייצר ג׳יבריש. בנוסף, כשמנסים להרחיב את חלון ההקשר מעבר ל־32,768 טוקנים באמצעות YaRN, המפתחים מזהירים במפורש שיכולת זיהוי המיקום בזמן ובמרחב נפגעת קשות. במשימות של סוכנים אוטונומיים מורכבים הוא עדיין חלש, עם הצלחה של 25.5 אחוזים בלבד במבחן AndroidWorld וצניחה ל־29 אחוזים במבחן ScreenSpot Pro.

שאלות
נפוצות

האם הוא מסוגל לחלץ טקסט בעברית מתמונות?

השפה המדווחת היחידה בכרטיס המודל היא אנגלית. כל עוד לא מבוצע כוונון עדין למסמכים מקומיים, אין להסתמך עליו לחילוץ עברית או לפענוח חשבוניות ישראליות.

כמה זיכרון דרוש כדי לנתח וידאו ארוך?

המודל תופס קצת יותר מ־6 גיגה בייט בזיכרון, אבל וידאו מייצר כמות עצומה של טוקנים ויזואליים. כדי לנצל את מלוא חלון ההקשר של 32k טוקנים עם וידאו תצטרכו כרטיס עם לפחות 16 עד 24 גיגה זיכרון וידאו, או להגביל את הרזולוציה ומספר הפריימים.

איך מריצים

בזכות הכימות ל־4 ביט, משקל הקבצים עומד על 6.4 גיגה בייט בלבד. כרטיס מסך ביתי בודד עם 8 עד 12 גיגה זיכרון וידאו יספיק כדי להרים אותו, למשל כרטיסי RTX 3060 או 4060 ומעלה. בשביל להריץ אותו צריך להתקין את ספריית transformers ישירות מ־GitHub כדי למנוע שגיאות זיהוי של הארכיטקטורה, יחד עם חבילת qwen-vl-utils לטעינת מדיה.

אם אתם צריכים לנתח מדי פעם סרטון ארוך ולא רוצים לתחזק שרת פועל או להגדיר סביבות פיתון מקומיות עם decord, לפעמים פשוט יותר לצרוך את המודל דרך ספק ענן. אבל לעבודה רציפה, חילוץ מידע קבוע ממסמכים ופרטיות מלאה של התמונות, הרצה מקומית על כרטיס אחד משתלמת בהרבה.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="unsloth/Qwen2.5-VL-7B-Instruct-unsloth-bnb-4bit")
print(pipe("שלום"))

הרישיון

המודל משוחרר ברישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי מלא, שינוי הקוד והפצה פנימית או חיצונית בתוך מוצרים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗