GPT
L

llama3-llava-next-8b

קוד פתוח

lmms-labרישיון לא דווח2024-04-20

  • transformers
  • safetensors
  • llava
  • text-generation
  • conversational

מודל ראייה ושפה שמחבר בין יכולות התמונה של ארכיטקטורת LLaVA לבין בסיס הטקסט של Llama 3. הוא מיועד למי שמחפש צ'אט מולטימודלי פתוח בגודל בינוני לניסויי מחקר עצמאיים.

  • 8.4Bפרמטרים
  • 8,192טוקנים בהקשר
  • 15.6 GBמשקל הקבצים
  • 2,187הורדות בחודש

מה זה

מדובר במודל שמבוסס על Meta-Llama-3-8B-Instruct ועבר אימון נוסף כדי לנתח תמונות ולענות על שאלות לגביהן באמצעות ארכיטקטורת LlavaLlamaForCausalLM. הבסיס של לאמה 3 נותן לו הבנת שפה טובה יותר בהשוואה לגרסאות ישנות שהסתמכו על לאמה 2, והחיבור הזה מתאים לעיבוד שיחות שמשלבות תמונות וטקסט בחלון הקשר של 8,192 טוקנים.

תהליך האימון שלו התבסס על הקוד של LLaVA-1.6 וכלל מגוון מקורות מידע, כולל כחצי מיליון זוגות תמונה וטקסט מסוננים, מאות אלפי דוגמאות למענה על שאלות אקדמיות מבוססות תמונה, ונתונים שנוצרו באמצעות מודלים של OpenAI כמו GPT-4V. הוא רץ על ספריות transformers המוכרות, כך שאין צורך בכלים ייחודיים כדי לטעון אותו, אבל חשוב להבין שמדובר בתוצר מחקרי שנועד בעיקר לבדוק את השילוב בין מנוע הטקסט החדש לראייה ממוחשבת.

מתאים ל

  • מחקר מולטימודלי

    בדיקת היכולות של ארכיטקטורת LLaVA בשילוב הבסיס החזק של לאמה 3 בניתוח תמונות.

  • מענה על שאלות מתמונה

    ניתוח ויזואלי של דיאגרמות ותרשימים אקדמיים בסביבת ניסוי סגורה וללא צורך בענן.

  • פיתוח בוטים ויזואליים

    ניסויים ביצירת שיחות מבוססות תמונה למטרות למידה ותחביב על חומרה מקומית.

איפה זה נופל

היוצרים מגדירים את השימוש בו למטרות מחקר בלבד ואוסרים מפורשות שימוש מסחרי, כך שאי אפשר לשלב אותו במוצר אמיתי. בנוסף, האימון כלל מידע שיוצר על ידי GPT-4V ו־ShareGPT, מה שמכפיף אתכם לתנאי השימוש המחמירים של OpenAI. הכרטיס לא מציג ציוני בנצ'מרק מסודרים או מבחני ביצועים, ולא ידוע איך הוא מתמודד עם קריאת טקסט מורכב או זיהוי פרטים קטנים.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה באפליקציה מסחרית?

לא. המפתחים כתבו בפירוש שהשימוש מוגבל למחקר ותחביב בלבד ואסור למטרות מסחריות. בנוסף, השימוש בדאטה שיוצר על ידי מודלים של OpenAI מגביל את היכולת להפיץ אותו במוצר.

איזה כרטיס מסך נדרש כדי להריץ אותו מקומית?

המשקלים שוקלים 15.6 גיגה בפורמט הרגיל, ולכן תצטרכו כרטיס עם 24 גיגה זיכרון כדי לעבוד בצורה נוחה. אם תבצעו כימות לדיוק נמוך יותר, תוכלו להריץ אותו גם על כרטיסים צנועים יותר של 16 גיגה.

איך מריצים

כדי להריץ אותו בדיוק float16 מלא תצטרכו כרטיס מסך עם לפחות 24 גיגה זיכרון, כמו RTX 3090 או A10, מכיוון שקבצי המשקולות לבדם תופסים 15.6 גיגה לפני חישובי ההקשר. אם תמירו אותו לכימות של 4 ביט תוכלו להסתפק גם בכרטיס ביתי פשוט יותר של 12 או 16 גיגה.

ההרצה מתבצעת דרך ספריית transformers הרגילה של פייתון. אם אתם לא מחזיקים שרת ייעודי וצריכים רק בדיקה מזדמנת של תמונות, הקמה ותחזוקה של מכונה עם מעבד גרפי חזק תעלה לכם יותר מאשר פנייה ישירה ל־API מסחרי קיים.

from transformers import pipeline

pipe = pipeline("text-generation", model="lmms-lab/llama3-llava-next-8b")
print(pipe("שלום"))

הרישיון

הרישיון של הפרויקט עצמו לא דווח בעמוד, אך היוצרים מציינים איסור מפורש על כל שימוש מסחרי ומגבילים אותו למחקר בלבד. מעבר לזה, אתם כפופים לרישיון הבסיס של מטא ללאמה 3 ולתנאי השימוש של OpenAI בגלל הנתונים ששימשו לאימון.

הרישיון המלא בעמוד המודל ↗