GPT
Y

Yi-VL-6B

קוד פתוח

01-aiapache-2.02023-12-25

  • pytorch
  • llava
  • image-text-to-text
  • conversational

מודל ראייה ושפה קומפקטי שמביא יכולות שיחה סביב תמונות באנגלית וסינית. הוא מעניין בעיקר למי שמחפש חלופה מקומית לניתוח תמונות שלא דורשת שרת עתיר כרטיסים.

  • 4,096טוקנים בהקשר
  • 18.5 GBמשקל הקבצים
  • 2,165הורדות בחודש
  • 124לייקים

מה זה

הבסיס כאן הוא ארכיטקטורת Llava שלוקחת מקודד תמונה מסוג CLIP ViT-H/14, מעבירה אותו דרך שכבת קישור, ומחברת אותו למודל השפה Yi-6B-Chat. התוצאה יודעת לקבל תמונה יחידה יחד עם טקסט, להבין את התוכן הוויזואלי, ולענות על שאלות בכמה סבבים של שיחה. המודל תוכנן מראש לעבודה דו לשונית שוטפת, כך שהוא קורא ומייצר אנגלית וסינית בלי העדפה בולטת לאחת מהן.

ההבדל המשמעותי מול מודלים קלים אחרים הוא האימון התלת שלבי שהקבוצה עשתה, כולל שלב ייעודי ברזולוציה מוגדלת שנועד לתפוס פרטים קטנים. לפי המפתחים, סדרת Yi-VL תפסה את המקום הראשון במבחני MMMU באנגלית ו־CMMMU בסינית ביחס למודלים פתוחים בזמן שחרורו, מה שאומר שהוא מתמודד טוב יותר מהממוצע עם שאלות רב תחומיות שדורשות היגיון ולא רק תיאור שטחי של התמונה.

מתאים ל

  • חילוץ מידע מתמונות בסיסיות

    הבנת מסמכים פשוטים, שלטים ותרשימים באנגלית או סינית בגודל מודל שלא דורש תשתית כבדה.

  • צ'אט סביב תמונה בודדת

    מענה על שאלות המשך לגבי תצלום יחיד שהמשתמש מעלה, תוך שמירה על הקשר השיחה.

  • תיוג ויזואלי של קטלוגים

    סריקה של מאגרי תמונות וייצור תיאורים מפורטים באנגלית באופן מקומי ופרטי לגמרי.

איפה זה נופל

המגבלה הכי קריטית היא הרזולוציה. כל תמונה נדחסת ומתוחה לתוך גודל קבוע של 448 על 448 פיקסלים, כך שתמונות חדות מאבדות פרטים וטקסט קטן עלול להימרח לחלוטין. הוא גם לא יודע לקבל יותר מתמונה אחת בכל שיחה, ואין תמיכה בווידאו או ביצירת תלת ממד.

בנוסף, הכרטיס מציין במפורש נטייה להזיות. כשיש בסצנה הרבה עצמים, הוא נוטה לפספס אובייקטים או להמציא פרטים שלא קיימים בתמונה. חלון ההקשר מוגבל ל־4,096 טוקנים, ולגבי עברית אין שום תיעוד או התחייבות, כך שסביר להניח שפענוח טקסט עברי מתוך תמונות יעבוד רע מאוד.

אותה משפחה

Yi-VL יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לחילוץ טקסט בעברית מתוך מסמכים?

לא. המודל אומן ונבדק על אנגלית וסינית בלבד, ורזולוציית הקלט שלו מוגבלת ל־448 על 448 פיקסלים. טקסטים קטנים נמרחים ברזולוציה הזו, ובהיעדר אימון ייעודי על השפה העברית הוא כנראה ייצר שגיאות והזיות.

האם אפשר להריץ אותו על מחשב ביתי בלי כרטיס מסך חזק?

לא כדאי לנסות. הקבצים שוקלים 18.5 גיגה בייט והמודל דורש כרטיס מסך עם לפחות 24 גיגה בייט זיכרון כמו RTX 3090 או RTX 4090 כדי לעבוד בצורה סבירה. הרצה על מעבד רגיל תהיה אטית להחריד ולא מעשית.

אפשר להעלות כמה תמונות יחד כדי להשוות ביניהן?

אי אפשר. המודל תומך כרגע בקלט של תמונה אחת בלבד לכל שיחה. אם יש לכם צורך בהשוואת מוצרים, ניתוח רצף פריימים או מעקב אחרי שינויים בין תמונות, תצטרכו לחפש פתרון אחר.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־18.5 גיגה בייט בדיוק של bfloat16, מה שאומר שצריך לפחות כרטיס מסך אחד עם 24 גיגה בייט זיכרון כדי להריץ אותו בצורה יציבה. כרטיסים צרכניים כמו RTX 3090 או RTX 4090 יספיקו להסקה מקומית, ובסביבת ענן אפשר להסתפק ב־A10 או A30 בודד.

מי שאין לו כרטיס ייעודי כזה בשרת ימצא שזה כבד מדי, ובמצב כזה עדיף לצרוך מודלי ראייה דרך ספקי API מוכנים. הגרסה הגדולה יותר בסדרה, 34B, כבר דורשת מערך של ארבעה כרטיסי 4090 או כרטיס A800 של 80 גיגה בייט, כך שגרסת ה־6B היא האופציה הריאלית היחידה להרצה זולה על שרת בודד.

pip install -U huggingface_hub
hf download 01-ai/Yi-VL-6B

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0, שמאפשר שימוש חופשי, שינוי והפצה. עם זאת, היוצרים מציינים שכדי להשתמש במודל במוצר מסחרי נדרש לקבל אישור רשמי בחינם באמצעות שליחת אימייל, ורק לאחר מכן מקבלים את ההיתר המלא לשימוש מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗