GPT
L

llava-v1.5-7b-llamafile

קוד פתוח

mozilla-aillama22023-11-20

  • gguf
  • llamafile
  • GGUF

גרסת llamafile של מודל ראייה ושפה שרץ בקובץ בינארי בודד בלי תלויות מסובכות. הוא מיועד למי שרוצה לעבד תמונות ולשאול עליהן שאלות מקומית בלי לגעת בענן.

  • 49.4 GBמשקל הקבצים
  • 5,332הורדות בחודש
  • 188לייקים

מה זה

מוזילה לקחו את LLaVA 1.5, מודל של 7 מיליארד פרמטרים שמבוסס על LLaMA ו־Vicuna, וארזו אותו בתצורת llamafile. המודל אומן על שילוב של חצי מיליון זוגות תמונה וטקסט מסוננים ממאגרים כמו LAION, לצד עוד כ־158 אלף הוראות מולטימודליות שנוצרו על ידי GPT, דאטה אקדמי של שאלות ותשובות על תמונות, ושיחות מ־ShareGPT. השילוב הזה נותן לו יכולת לנהל שיחה ישירה על קבצי תמונה שתזינו לו.

במקום להסתבך עם ספריות פייתון וגרסאות CUDA, הפורמט הזה הופך את כל העסק לקובץ הפעלה עצמאי. הוא נבדק מול 12 מבחני ביצועים שונים של שאלות ותשובות ויכולת מעקב אחרי הוראות. בהשוואה למודלי טקסט בלבד באותו סדר גודל, כאן מקבלים הבנה ויזואלית בסיסית וטובה לזיהוי אובייקטים וניתוח סצנות, אם כי הוא עדיין מודל יחסית קטן שלא מתחרה במערכות ענק מסחריות.

מתאים ל

  • ניתוח תמונות מקומי

    מאפשר לשאול שאלות על תמונות ישירות מהטרמינל בלי להעלות קבצים פרטיים לרשת.

  • מחקר מולטימודלי

    משמש לבדיקת יכולות הבנת תמונה של מודלים פתוחים על גבי חומרה אישית.

  • מענה אוטומטי על תרשימים

    עונה על שאלות מתוך דיאגרמות ותרשימים פשוטים בזכות אימון על נתוני VQA.

איפה זה נופל

יוצרי המודל הגדירו אותו מראש כמיועד למחקר ולחובבים, ולא כמוצר מוגמר לייצור. הנתונים מבוססים בחלקם על פלטים סינתטיים של GPT ועל שיחות ShareGPT, מה שאומר שהוא עלול להמציא פרטים, להזות עובדות לגבי מה שמופיע בתמונה, או לפספס פרטים קטנים ומורכבים. לפני שמשלבים אותו בזרימת עבודה אמיתית, חייבים לבדוק איך הוא מתמודד עם טקסט קטן בתוך תמונה ועם תנאי תאורה קשים.

שאלות
נפוצות

האם המודל תומך בעברית בצורה טובה?

הוא אומן בעיקר על אנגלית ודאטה בינלאומי בסיסי. הוא עשוי להבין מילים בודדות בעברית, אבל הוא לא מיועד לכך ומומלץ לתשאל אותו באנגלית כדי לקבל תשובות מדויקות.

למה הקבצים שוקלים כמעט 50 גיגה למודל של 7 מיליארד פרמטרים?

המשקל הגבוה נובע מכך שהמאגר כולל מספר גרסאות של קובצי llamafile עם רמות שונות של דחיסה ומשקולות מלאות. אתם לא צריכים להריץ את כולם, אלא רק להוריד את הקובץ המתאים לחומרה שלכם.

איך מריצים

ההורדה כבדה מאוד ומגיעה לכמעט 50 גיגה ב־12 קבצים, כך שחובה לוודא שיש לכם מספיק שטח אחסון וחיבור מהיר לפני שמתחילים. מודל של שבעה מיליארד פרמטרים דורש כרטיס מסך עם לפחות 8 עד 12 גיגה של זיכרון כדי לרוץ בצורה חלקה, או מעבד חזק עם מספיק זיכרון ראם אם אתם מתכוונים להריץ אותו ישירות על המחשב.

אם אתם צריכים רק לבדוק תמונה פה ושם ולא רוצים להחזיק שרת ייעודי או לתפוס עשרות גיגות בכונן, שימוש ב־API חיצוני יהיה מהיר וזול בהרבה. הריצה המקומית שווה את המאמץ בעיקר אם המידע רגיש או כשחייבים עבודה מנותקת מרשת.

ollama run hf.co/mozilla-ai/llava-v1.5-7b-llamafile:Q4_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל כפוף לרישיון Llama 2 של מטא. הרישיון מתיר שימוש מסחרי ומחקרי, אבל כולל הגבלות מוגדרות מראש, כולל דרישה לאישור מיוחד אם מגיעים ליותר מ־700 מיליון משתמשים פעילים בחודש, ואיסור להשתמש בפלטים שלו כדי לאמן מודלים מתחרים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗