GPT
F

FastVLM-1.5B

קוד פתוח

appleapple-amlr2025-08-25

  • ml-fastvlm
  • safetensors
  • llava_qwen2
  • text-generation
  • transformers

מודל ראייה ושפה קטן במיוחד שתוכנן לתת מענה מהיר מאוד לתמונות ברזולוציה גבוהה. הוא מתאים למי שחייב עיבוד תמונה מקומי ולא רוצה לשלם בזמן תגובה כבד.

  • 1.9Bפרמטרים
  • 32,768טוקנים בהקשר
  • 3.6 GBמשקל הקבצים
  • 3,387הורדות בחודש

מה זה

מדובר במודל שמשלב בין מקודד ראייה היברידי בשם FastViTHD לבין מודל שפה ממשפחת Qwen2, בהיקף של כמעט שני מיליארד פרמטרים. הרעיון המרכזי כאן הוא חיתוך אגרסיבי של מספר הטוקנים שמייצר רכיב התמונה, מה שמקצר משמעותית את זמן ההמתנה לטוקן הראשון לעומת מודלים מקבילים.

במבחני ביצועים הוא מציג תוצאות חזקות במיוחד במסמכים וגרפים, למשל ציון של 88.3 ב־DocVQA ו־80.1 ב־ChartQA. המשמעות היא שקריאת טקסט מתוך תמונות ותרשימים עובדת ברמה מפתיעה לגודל שלו, אפילו בהשוואה לארכיטקטורות כבדות בהרבה.

מצד שני, במבחני הבנה רב-תחומית כלליים יותר כמו MMMU הוא נעצר על 37.8. זה ממחיש בבירור שמדובר בכלי ממוקד לחילוץ מידע ויזואלי וטקסטואלי, ולא במערכת להסקה לוגית מורכבת.

מתאים ל

  • חילוץ נתונים מדוחות וגרפים

    הוא מגיע לציון 80.1 ב־ChartQA ומפענח נתונים מספריים מתרשימים במהירות ובלי צורך במודל ענק.

  • סריקת טקסט מתוך מסמכים

    עם 88.3 במבחן DocVQA, הוא מתאים מאוד לשליפת שדות מטפסים ומסמכים סרוקים בתוך תהליכי עיבוד מהירים.

  • מענה קל על שאלות מתמונות

    זמן התגובה הקצר לטוקן הראשון מתאים לעיבוד תמונות בזמן אמת על חומרה מקומית צנועה.

איפה זה נופל

החולשה העיקרית מופיעה כשמבקשים ממנו משימות שדורשות ידע כללי רחב או חשיבה מופשטת על תמונה, שם הוא מקבל ציונים נמוכים כמו 37.8 ב־MMMU ו־61.2 ב־RealWorldQA. בנוסף, חלון ההקשר אמנם מוגדר עד 32 אלף טוקנים, אבל בסיס השפה שלו הוא מודל קומפקטי שמייצר תשובות קצרות ועלול להזות עובדות כשמעמיסים עליו. אין בתיעוד שום מידע על תמיכה בשפות שאינן אנגלית, ולכן חילוץ טקסט בעברית עלול להיכשל לחלוטין בלי בדיקה מוקדמת.

אותה משפחה

FastVLM יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יצליח לקרוא מסמכים ותמונות בעברית?

הכרטיס והפרסום הרשמי לא מציינים תמיכה בעברית, ובסיס האימון ממוקד באנגלית. סביר להניח שבמשימות OCR בעברית הוא יתקשה או ייכשל, וחובה לבדוק דוגמאות בודדות לפני שמתכננים עליו.

איזה כרטיס מסך צריך בשביל להריץ אותו מקומית?

הקבצים שוקלים 3.6 גיגה-בייט בלבד ב־bfloat16. כרטיס מסך בסיסי עם 6 עד 8 גיגה-בייט של זיכרון יספיק לחלוטין כדי להריץ אותו בצורה חלקה.

איך מריצים

המשקל הכולל של הקבצים עומד על 3.6 גיגה-בייט בפורמט bfloat16, מה שאומר שכרטיס מסך ביתי פשוט עם 6 עד 8 גיגה זיכרון וידאו יחזיק אותו בקלות. ההרצה נעשית ישירות דרך ספריית ml-fastvlm של אפל עם סקריפט ייעודי, או דרך Transformers תוך הפעלת אפשרות להרצת קוד מרוחק.

אם כל מה שאתם צריכים זה לסרוק קבלות, מסמכים או תרשימים פשוטים בקצב גבוה, הרצה עצמית פה היא עניין זול ומהיר מאוד. אם המטרה היא ניתוח שיחה מעמיק על תמונות או חיבור לכמויות עבודה מזעריות שלא מצדיקות שרת דלוק, עדיף להשתמש ב־API חיצוני.

pip install -U huggingface_hub
hf download apple/FastVLM-1.5B

הרישיון

המודל שוחרר תחת רישיון ייעודי של אפל בשם apple-amlr. זה אינו רישיון קוד פתוח סטנדרטי כמו MIT או Apache, ובדרך כלל רישיונות המחקר של אפל מגבילים את השימוש לצורכי מחקר בלבד ואוסרים הטמעה מסחרית ישירה. לפני שילוב בקוד מוצר חובה לקרוא את נוסח הרישיון המלא.

הרישיון המלא בעמוד המודל ↗