GPT
F

FastVLM-0.5B

קוד פתוח

appleapple-amlr2025-08-25

  • ml-fastvlm
  • safetensors
  • llava_qwen2
  • text-generation
  • transformers

מודל ראייה ושפה קטן במיוחד שמתמקד בזמן תגובה מהיר מאוד לתמונה ראשונה. אפל בנו אותו כדי לעבד תמונות ברזולוציה גבוהה בלי לחנוק את החומרה.

  • 759Mפרמטרים
  • 32,768טוקנים בהקשר
  • 1.4 GBמשקל הקבצים
  • 9,198הורדות בחודש

מה זה

מדובר במודל שמשלב בין מעבד תמונה היברידי שנקרא FastViTHD לבין מודל שפה שמבוסס על Qwen2. המטרה העיקרית שלו היא לחסוך בטוקנים שהתמונה מייצרת, מה שמקצר משמעותית את זמן ההמתנה לתשובה הראשונה בהשוואה למודלים מקבילים כמו LLaVA OneVision 0.5B.

במבחני ביצועים רואים שהוא חזק בעיקר במשימות מובנות של מסמכים וגרפים, למשל ציון של 82.5 ב DocVQA ו 76 ב ChartQA, תוצאות מרשימות לגודל של פחות ממיליארד פרמטרים. מצד שני, במבחנים שדורשים היגיון רב תחומי מורכב כמו MMMU הוא מגיע רק ל 33.9, שזה ציון נמוך שמבהיר שלא מדובר בתחליף למודלי ענק.

מתאים ל

  • קריאת מסמכים וקבלות

    התוצאה של 82.5 ב DocVQA מאפשרת לחלץ מידע מטפסים במהירות מקומית.

  • ניתוח גרפים ודוחות

    ביצועים טובים ב ChartQA שמתאימים להבנת מגמות בתרשימים פשוטים.

  • זיהוי טקסט מהיר בתמונות

    שילוב של קידוד תמונה יעיל וציון 63.9 ב OCRBench למענה מהיר.

איפה זה נופל

החולשה העיקרית מגיעה במבחנים של הבנה וידע כללי. במבחן InfoVQA הוא מקבל 46.4 בלבד, וב RealWorldQA הוא עומד על 56.1, מה שאומר שתמונות מורכבות מהעולם האמיתי מבלבלות אותו. חלון ההקשר אמנם מוגדר כ 32,768 טוקנים, אבל יכולות הניתוח של מודל שפה בגודל כזה מוגבלות מאוד. לפני שמשלבים אותו במערכת, צריך לוודא שהוא לא ממציא עובדות מול תמונות עמוסות בפרטים.

אותה משפחה

FastVLM יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מתאים לשימוש על מכשירי קצה?

כן, המשקל הנמוך ומעבד התמונה המהיר נועדו בדיוק לחסוך במשאבים. הוא דורש מעט זיכרון ויכול לרוץ מקומית בלי תלות ברשת.

במה הוא שונה מגרסאות ה 1.5B וה 7B של FastVLM?

הגרסה הזו מהירה וקלה בהרבה, אך מפסידה בדיוק. בבדיקות מול גרסת ה 7B קיים פער של כמעט 30 נקודות במשימות כמו InfoVQA.

איך מריצים

המשקל הכולל של הקבצים עומד על 1.4 גיגה בייט בדיוק bfloat16, כך שהוא נכנס בקלות לכל כרטיס מסך בסיסי או מעבד גרפי של מחשב נייד. אפשר להריץ אותו עם הקוד הרשמי של הספרייה ml fastvlm או דרך ספריית transformers הרגילה באמצעות trust remote code.

אם אתם צריכים עיבוד מקומי של תמונות ומסמכים בזמן אמת, הרצה עצמאית כאן היא הבחירה הנכונה כי המודל קל מאוד ולא דורש שרתים יקרים. שירותי ענן חיצוניים יהיו עדיפים רק אם אתם חייבים הבנה מורכבת של תמונות שמעבר לחילוץ נתונים פשוט.

pip install -U huggingface_hub
hf download apple/FastVLM-0.5B

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apple amlr. מדובר ברישיון מחקר של אפל, ולכן חובה לבדוק היטב את תנאי השימוש המדויקים לפני שמשלבים אותו במוצר מסחרי פעיל או בהפצה מסחרית.

הרישיון המלא בעמוד המודל ↗