GPT
L

llava-llama-3-8b-v1_1-gguf

קוד פתוח

xtunerרישיון לא דווח2024-04-26

  • gguf
  • image-to-text
  • endpoints_compatible
  • conversational

חיבור ישיר בין ראייה ממוחשבת לבסיס החזק של Llama 3 בקבצי GGUF מוכנים לריצה. הוא מתאים למי שרוצה ניתוח תמונות מקומי בלי לגעת בתשתיות ענן או להסתבך עם המרות.

  • 20.1 GBמשקל הקבצים
  • 2,873הורדות בחודש
  • 226לייקים

מה זה

מדובר בשילוב בין Llama 3 בגרסת שמונה מיליארד פרמטרים לרכיב הראייה CLIP של OpenAI, ארוזים יחד בפורמט שמתאים ישירות לריצה מקומית. הפרויקט הזה לקח את ארכיטקטורת LLaVA ואימן אותה על מערכי נתונים גדולים יותר מקודמיו, כמו ShareGPT4V ו־InternVL, במטרה לשפר את היכולת להבין מה מופיע בפריים ולתרגם את זה לטקסט מדויק.

במבחני הביצועים רואים קפיצה ברורה מגרסאות 7B ו־8B הקודמות, במיוחד בהבנת תרשימים מדעיים ואיורים במבחן AI2D שמגיע ל־70 נקודות, לעומת כ־61 בגרסה המוקדמת. גם ב־MMBench הוא מציג שיפור עקבי באנגלית ובסינית. זה אומר שבמקום תיאורים גנריים של תמונות, הוא מתמודד טוב יותר עם גרפים, שאלות מורכבות על איורים והבנה כללית של סצנה.

מתאים ל

  • ניתוח תרשימים וגרפים

    הוא מגיע לציון 70 במבחן AI2D ומתמודד היטב עם שאלות על דיאגרמות ואיורים טכניים.

  • עוזר מקומי מבוסס תמונות

    רץ ישירות ב־Ollama או llama.cpp בלי שליחת נתונים החוצה, בגרסת int4 קלה.

  • חילוץ תיאורים מתמונות

    אימון על ShareGPT4V מקנה לו יכולת לייצר תיאורי תוכן מפורטים יחסית באנגלית.

איפה זה נופל

למרות ההתקדמות, לא הכל ורוד בתוצאות המדידה. במבחן MME שבודק תפיסה והבנה כוללת, המודל הזה מקבל ציון נמוך יותר של 1469 נקודות לעומת יותר מ־1500 בגרסאות הישנות יותר, וגם בבדיקת הזיות POPE נרשמה ירידה קלה ל־86.4. הוא עדיין עלול להמציא פרטים שלא קיימים בתמונה או לפספס רכיבים קטנים מדי בגלל רזולוציה בסיסית של 336 פיקסלים בלבד. טקסט קטן בעברית או תרשימים עמוסים במיוחד יאתגרו אותו מהר מאוד.

אותה משפחה

llava-llama-3-8b-v1-1 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קבצים בדיוק חובה להוריד כדי שהוא יעבוד?

צריך להוריד שני קבצים, אחד מהם הוא מודל השפה עצמו, כמו גרסת ה־int4 או ה־f16, והשני הוא רכיב הראייה שנקרא llava-llama-3-8b-v1_1-mmproj-f16.gguf. בלי קובץ ה־mmproj המערכת לא תוכל לקרוא או לעבד תמונות כלל.

האם המודל תומך בטקסטים בעברית בתוך התמונה?

האימון התמקד בעיקר באנגלית ובסינית, ורזולוציית התמונה מוגבלת ל־336 פיקסלים. סביר מאוד שהוא יתקשה לקרוא מילים בעברית או לפענח שלטים ומסמכים מקומיים בצורה אמינה.

איך מריצים

ההרצה נעשית באמצעות llama.cpp או ישירות דרך Ollama בעזרת קובצי הגדרות מוכנים. כדי שהכול יעבוד צריך להוריד שני קבצים נפרדים, קובץ השפה עצמו וקובץ הפרוג'קטור הוויזואלי mmproj. יש כאן גרסת f16 כבדה שתדרוש כרטיס מסך עם זיכרון משמעותי, ולצידה גרסת int4 מכווצת שמאפשרת להריץ את כל הסיפור על חומרה ביתית סבירה או מעבד חזק.

אם כל מה שאתם צריכים זה לנתח כמה מסמכים ביום בלי תלות ברשת מקומית, ההתקנה הזו תעשה את העבודה. ברגע שצריך לשרת עומס של משתמשים בו־זמנית או לעבד עשרות תמונות בשנייה, כרטיס יחיד יחנוק את התור ועדיף לפנות ל־API ייעודי.

ollama run hf.co/xtuner/llava-llama-3-8b-v1_1-gguf:llava-llama-3-8b-v1_1-int4

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון של המודל לא דווח בעמוד שלו. המשמעות ברורה, מבחינה משפטית אין אישור מפורש להשתמש בו במוצר מסחרי, וכל שילוב שלו במערכת ייצור פנימית או מסחרית נעשה על אחריותכם בלבד.

הרישיון המלא בעמוד המודל ↗