GPT
B

bakLlava-v1-hf

קוד פתוח

llava-hfllama22023-12-05

  • transformers
  • safetensors
  • llava
  • image-text-to-text
  • vision

חיבור ישיר בין ראייה ממוחשבת לבסיס הטקסטואלי של מיסטרל שבעה מיליארד פרמטרים. פתרון קל יחסית שגובר במבחנים מסוימים על דגמים כבדים בהרבה.

  • 7.6Bפרמטרים
  • 32,768טוקנים בהקשר
  • 14.7 GBמשקל הקבצים
  • 6,351הורדות בחודש

מה זה

הארכיטקטורה לוקחת את מנגנון הראייה של לאווה ומלבישה אותו ישירות על גבי מודל השפה מיסטרל. במקום להישען על בסיס ישן ואיטי יותר, החיבור הזה מאפשר להבין תמונות מורכבות ולענות על שאלות חזותיות ברמת דיוק גבוהה. לפי נתוני המפתחים, השילוב הספציפי הזה מצליח לעקוף מודלים מבוססי לאמה שתיים בגודל של שלושה עשר מיליארד פרמטרים בחלק ממבחני הביצועים, למרות שהוא שומר על גודל קומפקטי בהרבה.

המערכת יודעת לקבל כמה תמונות ברצף בתוך אותה שיחה, לנתח דיאגרמות, לקרוא טקסט מתוך שלטים ולענות על שאלות רב ברירה בהתבסס על תוכן חזותי. האימון התבסס על מאות אלפי דוגמאות משולבות של תמונה וטקסט, כולל נתוני הוראות שנוצרו על ידי בינה מלאכותית ומאגרי שאלות ותשובות אקדמיים. היתרון המעשי כאן הוא חלון הקשר נדיב שמאפשר לשלוח היסטוריית שיחה ארוכה בלי לאבד את ההקשר של התמונות הראשונות.

מתאים ל

  • ניתוח תרשימים ודיאגרמות

    חילוץ תשובות ישירות מתוך איורים מדעיים או שאלות רב ברירה באנגלית.

  • השוואה בין מספר תמונות

    שליחת רצף של קבצים באותה הנחיה כדי לזהות הבדלים ושינויים ביניהם.

  • פיתוח פנימי ובדיקת היתכנות

    בחינת יכולות מולטימודליות על גבי תשתית מיסטרל ללא עלויות תשתית כבדות.

איפה זה נופל

הבעיה המרכזית נמצאת בדאטה שבו השתמשו לאימון. המפתחים עצמם מודים שהם אימנו את המודל על נתונים שכוללים את המאגר של לאווה, שאינו חופשי לשימוש מסחרי. מעבר לזה, המודל אומן רק באנגלית. אל תצפו ממנו לקרוא עברית מתוך תמונות או לנהל שיחה תקינה בשפה המקומית, וכל ניסיון לעשות זאת ייגמר בתשובות שבורות או בהזיות מוחלטות.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה באפליקציה מסחרית?

לא. למרות שהרישיון הרשמי הוא לאמה שתיים, המפתחים מצהירים שהאימון כלל מאגרים שאינם פתוחים לשימוש מסחרי, ומבטיחים לתקן זאת רק בגרסה הבאה.

האם המודל יודע לקרוא עברית מתוך תמונות?

לא, המודל הוגדר ואומן עבור השפה האנגלית בלבד. הוא ייכשל בניסיון לזהות טקסט עברי במסמכים או בשלטים, ומומלץ להימנע משימוש כזה לחלוטין.

איך מריצים

אתם צריכים כרטיס מסך עם תמיכה בקיודה וספריית טרנספורמרס מעודכנת. המודל שוקל כמעט חמישה עשר גיגה בייט בדיוק המקורי, ולכן הרצה בציפה מלאה תדרוש כרטיס מקצועי יקר עם לפחות שישה עשר עד עשרים גיגה זיכרון גרפי פנוי רק למשקלים עצמם.

כדי לעבוד על חומרה ביתית סבירה או בסביבות פיתוח חינמיות, עדיף לטעון אותו בכימות של ארבעה ביטים דרך ביטס אנד בייטס, או לחלופין להפעיל פלאש אטנשן שתיים כדי לקצר זמני תגובה. אם אין לכם גישה למעבד גרפי ייעודי של לפחות שמונה גיגה לגרסה המכומתת, אין טעם לנסות להריץ מקומית, ועדיף להשתמש בסביבות ענן מוכנות.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="llava-hf/bakLlava-v1-hf")
print(pipe("שלום"))

הרישיון

הרישיון המדווח הוא רישיון הקהילה של לאמה שתיים, אבל דף המודל מציין במפורש שהנתונים ששימשו לאימון כוללים חומרים שאינם מורשים לשימוש מסחרי. המשמעות ברורה. אסור לשלב את המודל הזה במוצר מסחרי שנמכר ללקוחות, והוא מתאים כרגע אך ורק למחקר, לפיתוח פנימי או לניסויים אישיים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗