GPT
L

llava-llama-3-8b-v1_1-transformers

קוד פתוח

xtunerרישיון לא דווח2024-04-26

  • xtuner
  • safetensors
  • llava
  • image-text-to-text
  • conversational

חיבור ישיר בין Llama 3 למודל הראייה של CLIP שנועד להבנת תמונות ושיחה עליהן. מתאים למי שחייב מודל ראייה מקומי בגודל בינוני ובפורמט סטנדרטי של transformers.

  • 8.4Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.6 GBמשקל הקבצים
  • 16,732הורדות בחודש

מה זה

המודל משלב את מודל השפה Meta Llama 3 8B Instruct עם מקודד הראייה CLIP-ViT-Large ברזולוציה של 336 פיקסלים. הצוות של XTuner אימן אותו על מאגרי נתונים גדולים יותר מהגרסאות הקודמות, שכוללים מעל 1.2 מיליון דוגמאות בחימום הראשוני מתוך ShareGPT4V-PT ומספר דומה בכוונון העדין מתוך InternVL-SFT. החיבור נעשה באמצעות שכבת תיאום מסוג MLP.

במבחני הביצועים רואים שיפור בולט לעומת LLaVA 1.5 וגרסאות מוקדמות של Llama 3. הוא מגיע לציון של 72.3 ב־MMBench באנגלית ו־70.0 ב־AI2D, מה שמראה הבנה עדיפה של דיאגרמות ותרשימים. מצד שני, במבחנים שמודדים הזיות ויזואליות כמו POPE או שאלות ידע כללי מבוססות תמונה כמו TextVQA, הציון כמעט לא זז ונשאר סביב 59 עד 86 נקודות, כך שאין כאן קפיצה ביכולת לפענח טקסט מורכב מתוך תמונה.

מתאים ל

  • מענה על שאלות מתרשימים

    קיבל 70.0 ב־AI2D, ולכן מתאים לחילוץ תשובות מתוך גרפים, דיאגרמות פשוטות ותרשימי זרימה.

  • תיאור תמונות לקטלוגים

    מייצר תיאורים מילוליים מפורטים של סצנות ואובייקטים ברורים ברזולוציה סטנדרטית.

  • סיווג ויזואלי מקומי

    רץ ישירות דרך transformers על שרת פנימי ללא תלות ברשת חיצונית לצורך בדיקת תוכן תמונות.

איפה זה נופל

המגבלה הכי קשה כאן היא רזולוציית התמונה, שנשארת נעולה על 336 על 336 פיקסלים בגלל מקודד ה־CLIP. אם תזרקו עליו מסמכים סרוקים, פונטים קטנים או פרטים זעירים, הוא פשוט יפספס אותם, כפי שמשתקף בציון הנמוך יחסית של 59.0 ב־TextVQA. בנוסף, במבחן MME הציון הכולל שלו מעט נמוך יותר אפילו מ־LLaVA 1.5 הישן, מה שרומז על חוסר יציבות בחלק מסוגי השאלות הוויזואליות. לפני שמשלבים אותו במערכת, חובה לבדוק ספציפית איך הוא מתמודד עם תמונות ברורות פחות או עם שאלות שדורשות ספירת אובייקטים מדויקת.

שאלות
נפוצות

האם המודל מתאים לקריאת קבלות או מסמכים בעברית?

לא. מקודד התמונה מוגבל לרזולוציה נמוכה של 336 פיקסלים, והמודל קיבל ציונים בינוניים ב־TextVQA גם באנגלית. טקסט קטן או שפות שאינן אנגלית וסינית יגרמו לו להמציא פרטים.

איך הגרסה הזו שונה מהגרסאות האחרות של XTuner בעמוד?

הגרסה הזו ארוזה בתבנית HuggingFace LLaVA הרשמית ומוכנה לעבודה ישירה עם פונקציית pipeline הרגילה. הגרסאות האחרות מיועדות לכלי האימון של XTuner עצמם או להרצה מכווצת בפורמט GGUF.

איך מריצים

המשקלים שוקלים 15.6 גיגה-בייט בדיוק של float16, ומחולקים ל־13 קבצים. כדי להריץ אותו מקומית בלי קוונטיזציה תצטרכו כרטיס מסך עם לפחות 20 עד 24 גיגה-בייט של זיכרון גרפי, כמו RTX 3090, RTX 4090 או כרטיס שרת מקביל, במיוחד אם אתם רוצים לנצל חלק מחלון ההקשר שמגיע ל־8,192 טוקנים.

ההטמעה פשוטה מאוד ועובדת ישר דרך pipeline של ספריית transformers בלי צורך בקוד מותאם אישית. אם אין לכם חומרה כזו זמינה, קיימת גם גרסת GGUF ש־XTuner שחררו ומאפשרת הרצה חסכונית יותר על מעבדים רגילים, או שאפשר פשוט לפנות למודלי ראייה גדולים דרך ענן מסחרי אם הנתונים שלכם לא רגישים.

pip install -U huggingface_hub
hf download xtuner/llava-llama-3-8b-v1_1-transformers

הרישיון

הרישיון של המודל לא דווח בדף שלו. למרות שהוא מבוסס על Llama 3 שיש לה תנאי שימוש משלה ועל רכיבי קוד פתוח, אי אפשר לדעת מהכרטיס אם מותר להשתמש בו במוצר מסחרי או להפיץ אותו. במצב כזה, חברות וארגונים לא יכולים לקחת את הסיכון המשפטי להכניס אותו לפרודקשן.

הרישיון המלא בעמוד המודל ↗