GPT
Y

Yi-VL-34B

קוד פתוח

01-aiapache-2.02023-12-25

  • pytorch
  • llava
  • image-text-to-text
  • conversational

מודל ראייה ושפה בקוד פתוח המשלב בסיס טקסטואלי חזק של 34 מיליארד פרמטרים. מתאים למי שחייב יכולות ניתוח תמונה מתקדמות באנגלית או בסינית בהרצה עצמית.

  • 4,096טוקנים בהקשר
  • 71.4 GBמשקל הקבצים
  • 430הורדות בחודש
  • 265לייקים

מה זה

המודל מחבר מקודד תמונה מסוג CLIP ViT ישירות אל מודל השפה Yi-34B-Chat באמצעות שכבת תיווך של שתי שכבות MLP. המבנה הזה נשען על ארכיטקטורת LLaVA המוכרת, אבל מביא אותה לגודל משמעותי של 34 מיליארד פרמטרים. הוא מיועד לשיחה סביב תמונה ומאפשר שאלות ותשובות בכמה סבבים, חילוץ מידע וסיכום נתונים חזותיים.

במדדי MMMU באנגלית ו־CMMMU בסינית נכון לינואר 2024, המודל עקף את כל שאר מודלי הקוד הפתוח. בפועל המשמעות היא יכולת הסקת מסקנות רב תחומית ברמה אקדמית מתוך תרשימים, דיאגרמות ושאלות מורכבות, ולא רק זיהוי בסיסי של עצמים.

מתאים ל

  • ניתוח תרשימים וגרפים

    הבסיס החזק במבחני MMMU עוזר לפענח גרפים טכניים באנגלית ובסינית ברזולוציה מתאימה.

  • מענה על שאלות מתמונה

    תומך בשיחה מרובת סבבים על גבי תמונה יחידה לצורך תחקור חזותי מתמשך.

  • חילוץ מידע דו לשוני

    מתאים לעיבוד תמונות המכילות טקסט משולב באנגלית ובסינית הדורש הבנה עמוקה.

איפה זה נופל

ההגבלה הבולטת ביותר היא הרזולוציה. המודל מכווץ או מותח כל תמונה ל־448 על 448 פיקסלים בדיוק. תמונות מפורטות מאוד יאבדו פרטים קריטיים, וטקסט קטן בעברית או באנגלית עלול להימרח לחלוטין. בנוסף, הוא מקבל רק תמונה אחת בכל שיחה ולא יודע להשוות בין כמה תמונות במקביל.

היוצרים מדווחים בגלוי על הזיות חזותיות. בסצנות צפופות עם פריטים רבים, המודל נוטה להמציא פרטים שלא קיימים או לזהות עצמים לא נכון. אל תבנו עליו לאיתור אנומליות קריטיות בלי בדיקה אנושית.

אותה משפחה

Yi-VL יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להעלות כמה תמונות באותה שיחה?

לא. המודל מוגבל כרגע לתמונה בודדת כקלט. אי אפשר לבצע השוואות בין מסמכים או לנתח רצף תמונות.

האם הוא מתאים לזיהוי מסמכים וטקסט צפוף?

בדרך כלל לא. בגלל שהתמונה מומרת לגודל של 448 על 448 פיקסלים, אותיות קטנות ופרטים עדינים נהרסים בתהליך.

האם מותר להשתמש בו במוצר מסחרי?

כן, אך זה דורש פנייה מקדימה. הרישיון הוא Apache 2.0 והשימוש חינמי, אך נדרש לשלוח מייל ליוצרים כדי לקבל הרשאה מסחרית.

איך מריצים

בשביל להריץ אותו בהסקה נדרשת חומרה כבדה. המפתחים ממליצים על כרטיס שרת בודד A800 בנפח 80GB, או מערך של ארבעה כרטיסי RTX 4090 כדי להחזיק את 71.4 הג'יגה בייט של המשקולות בזיכרון. אם אין לכם גישה לשרת ייעודי כזה, גרסת ה־6B של אותה סדרה רצה על כרטיס RTX 3090 או 4090 בודד.

ההטמעה בפועל מבוססת PyTorch וקוד LLaVA. אם העומס שלכם נמוך או שאין לכם חומרה כזו זמינה, החזקה עצמית תהיה יקרה מאוד בהשוואה לשליחת קריאות לשירות ענן חיצוני.

pip install -U huggingface_hub
hf download 01-ai/Yi-VL-34B

הקבצים

31 קבצים במאגר, 71.4 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הקוד והמשקולות מפורסמים תחת רישיון Apache 2.0, אך המפתחים דורשים הגשת בקשה במייל לקבלת אישור רשמי לפני שימוש מסחרי במוצר. האישור ניתן בחינם, אך חובת הפנייה קיימת.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗