GPT
F

FastVLM-0.5B-ONNX

קוד פתוח

onnx-communityapple-amlr2025-05-14

  • transformers.js
  • onnx
  • llava_qwen2
  • text-generation
  • fastvlm

גרסת ONNX קלה של מודל ראייה-שפה שמיועדת לרוץ ישירות בדפדפן או במכשירי קצה. מקבלים יכולת ניתוח תמונה וטקסט בלי להחזיק שרת יקר ברקע.

  • 32,768טוקנים בהקשר
  • 9.9 GBמשקל הקבצים
  • 521הורדות בחודש
  • 109לייקים

מה זה

מדובר בהמרה לפורמט ONNX של מודל ראייה מבוסס Llava ו־Qwen2, עם חצי מיליארד פרמטרים. התפקיד שלו הוא לקחת תמונה וטקסט, ולהחזיר תשובה טקסטואלית, מתיאור פשוט ועד מענה לשאלות על מה שרואים בפריים. ארכיטקטורת FastVLM שפותחה במקור על ידי אפל מתמקדת בקידוד ויזואלי יעיל, במטרה לקצר זמני עיבוד.

היתרון המרכזי כאן הוא ההתאמה לסביבות ווב דרך transformers.js. עם 24 שכבות וחלון הקשר של 32,768 טוקנים, הוא נותן מרחב נשימה לשיחות ארוכות או להוראות מפורטות, אבל צריך לזכור שחצי מיליארד פרמטרים זה עדיין מודל זעיר. הוא לא יתחרה בהבנה העמוקה של מודלי ענק, אלא מיועד למשימות נקודתיות ומהירות.

מתאים ל

  • תיאור תמונות בדפדפן

    יצירת כתוביות לתמונות מקומיות בלי להעלות קבצים לשרת חיצוני.

  • זיהוי אלמנטים פשוטים

    מענה על שאלות קצרות לגבי תוכן של תמונה בתוך יישום ווב מקומי.

  • פיתוח כלי בדיקה פנימיים

    הדגמת יכולות מולטימודליות על חומרה מקומית ללא עלויות תשתית.

איפה זה נופל

הגודל הקומפקטי שלו אומר שהוא מועד להזיות, במיוחד בפרטים קטנים בתמונה או בקריאת טקסט צפוף. מעבר לזה, המשקל הכולל של 9.9 גיגה-בייט מחולק בין 37 קבצים שונים. זה סרבול רציני בזמן משיכה ראשונית, ובלי חיבור רשת חזק ומטמון מסודר החוויה בדפדפן עלולה להיתקע עוד לפני שהמודל התחיל לעבד טוקן אחד. כדאי לבדוק טוב איך הוא מתמודד עם השפה שלכם לפני שבונים עליו למוצר.

שאלות
נפוצות

האם אפשר להריץ את המודל ישירות בדפדפן בלי שרת?

כן, המודל מותאם לרוץ עם transformers.js ומשתמש ב־WebGPU. הבעיה העיקרית היא שצריך להוריד כמעט עשרה גיגה-בייט של קבצים, מה שהופך את הטעינה הראשונית לארוכה למדי.

האם המודל מתאים ליישום מסחרי בחברה?

הרישיון שלו מוגדר כ־apple-amlr, שזה רישיון מחקרי של אפל. לשימושים מסחריים מובהקים מומלץ לקרוא את התנאים המשפטיים המלאים של אפל, כי בדרך כלל הרישיונות האלה מגבילים פעילות עסקית.

איך מריצים

אתם מריצים אותו דרך חבילת transformers.js ב־npm, והוא מסוגל לעבוד לחלוטין בצד הלקוח בעזרת WebGPU. אין צורך בשרת עם GPU ייעודי כדי להתחיל לשחק איתו, אבל נפח הקבצים הכולל להורדה מגיע לכמעט עשרה גיגה-בייט, שזה משקל כבד מאוד לטעינה ראשונית בדפדפן של משתמש קצה.

אם אתם צריכים לספק את השירות לקהל רחב בלי לחנוק לו את רוחב הפס או את הזיכרון במחשב, כנראה שעדיף להרים קונטיינר משלכם או להשתמש ב־API מרוחק. הרצה מקומית כזו מתאימה בעיקר ליישומים פנימיים, כלי דסקטופ או סביבות שבהן הפרטיות דורשת שאף פיקסל לא ייצא מהרשת המקומית.

pip install -U huggingface_hub
hf download onnx-community/FastVLM-0.5B-ONNX

הרישיון

הרישיון הוא apple-amlr, רישיון המחקר של אפל. הוא מיועד בעיקר למטרות מחקר והערכה, ולא רישיון קוד פתוח מתירני רגיל. אם אתם מתכננים להטמיע אותו במוצר מסחרי שמוכר שירותים, אתם חייבים לבדוק היטב את תנאי הרישיון של אפל ולוודא שהשימוש שלכם מותר.

הרישיון המלא בעמוד המודל ↗