GPT
L

LLaVA-13b-delta-v0

קוד פתוח

liuhaotianapache-2.02023-04-17

  • transformers
  • pytorch
  • llama
  • text-generation
  • text-generation-inference

הורדה של משקלי דלתא שמתלבשים על מודל בסיס, למי שמחפש צ'אטבוט מולטימודלי פתוח שמבין תמונות וטקסט. המודל מתאים לחוקרים שרוצים לשחזר ניסויים מוקדמים בתחום הראייה הממוחשבת.

  • 24.3 GBמשקל הקבצים
  • 102הורדות בחודש
  • 219לייקים
  • 40שכבות

מה זה

הפרויקט מחבר יכולות שפה עם עיבוד תמונה על בסיס ארכיטקטורת LLaMA ואימון עדין בסגנון Vicuna. האימון הראשוני הסתמך על 595 אלף זוגות תמונה וטקסט מפולטרים ממאגר CC3M, ועוד 150 אלף דוגמאות של מעקב אחרי הוראות שנוצרו על ידי GPT. זה אפשר לו לתפקד כעוזר שיודע לענות על שאלות לגבי תוכן ויזואלי ולא רק לנתח טקסט יבש.

בבדיקות של היוצרים נבחנו 90 שאלות היגיון ויזואלי מתוך 30 תמונות ממאגר COCO, שנחלקו לשיחה, תיאור מפורט והסקה מורכבת, כאשר מודל GPT-4 שימש כשופט לאיכות התשובות. המודל נבחן גם על מאגר ScienceQA והגיע שם לתוצאות גבוהות בשילוב עם GPT-4, מה שהפך אותו לאחד הניסיונות הפתוחים הראשונים שהציגו חשיבה משולבת שכזו.

מתאים ל

  • מחקר אקדמי מולטימודלי

    שחזור תוצאות וניתוח היכולות על מאגרי נתונים כמו ScienceQA לפי הניסויים המקוריים.

  • מענה על שאלות מתמונות

    ניסויי מעבדה בתיאור תמונות והסקת מסקנות מתוכן ויזואלי מקומי ללא שליחת מידע החוצה.

  • בדיקת אימון עדין ויזואלי

    בחינת האופן שבו דלתא של 13 מיליארד פרמטרים משפיעה על מודל שפה קיים בעבודה עם תמונות.

איפה זה נופל

היוצרים מגדירים את המודל ככלי למחקר ולחובבים, ולא כמשהו שמיועד לפרודקשן. מעבר לעובדה שהוא אינו עצמאי ודורש הרכבה טכנית מסורבלת, ההערכה שלו נשענת על מדגם זעיר של 30 תמונות בלבד ושיפוט סינתטי של GPT-4, כך שאין שום אינדיקציה ליציבות שלו מול קלטים אמיתיים בעולם האמיתי.

שאלות
נפוצות

אפשר להוריד את הקבצים האלה ולהריץ ישר שיחה עם תמונה?

לא. הקבצים בעמוד הם רק ההפרש, הדלתא, מול מודל LLaMA המקורי. חובה להשיג את משקלי הבסיס של מטא ולהריץ סקריפט מיזוג כדי לייצר את המשקלים המלאים לעבודה.

המודל הזה יודע לענות ולנתח תמונות בעברית?

האימון נעשה על מאגרי תמונות וטקסט כמו CC3M והנחיות שנוצרו באנגלית. אין נתונים על תמיכה בעברית, ולכן לא כדאי לבנות עליו למשימות בשפה זו.

איך מריצים

אי אפשר לטעון את הקבצים האלה ישירות לתוך transformers ולהתחיל לעבוד. מדובר במשקלי דלתא בנפח של 24.3 גיגה בייט, שמחייבים אתכם להחזיק מראש את משקלי LLaMA המקוריים ולהריץ סקריפט המרה מיוחד ממאגר הגיטהאב כדי למזג אותם.

מבחינת חומרה, מודל 13B בדיוק float16 ידרוש כרטיס מסך עם לפחות 24 עד 32 גיגה בייט זיכרון רק כדי לטעון אותו לזיכרון לפני שמתחילים להריץ עליו שאילתות. אם אין לכם את משקלי הבסיס המקוריים של LLaMA או שרת מתאים עם כרטיס חזק, אין שום טעם להתעסק עם ההורדה הזו, ועדיף להשתמש בפתרונות ענן מוכנים.

from transformers import pipeline

pipe = pipeline("text-generation", model="liuhaotian/LLaVA-13b-delta-v0")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שבאופן רגיל מתיר שימוש מסחרי, שינויים והפצה חופשית של הקוד והמשקלים. העניין מסתבך בגלל שמדובר בדלתא שתלויה במשקלי הבסיס של LLaMA המקורית, כך שאתם כפופים בפועל גם לתנאי הרישיון המקוריים של מטא לפני שתוכלו להפיץ מוצר שלם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗