GPT
L

llama-joycaption-alpha-two-hf-llava

קוד פתוח

fancyfeastרישיון לא דווח2024-10-08

  • safetensors
  • llava
  • captioning

מודל ראייה ושפה שמייצר תיאורי תמונות מפורטים בלי צנזורה. הוא נבנה כדי לתייג דאטה עבור אימון מודלי תמונה, במיוחד איפה שכלים מסחריים מסרבים לגעת.

  • 8.5Bפרמטרים
  • 131,072טוקנים בהקשר
  • 16.6 GBמשקל הקבצים
  • 17,544הורדות בחודש

מה זה

הפרויקט הזה נועד לפתור בעיה ספציפית: מודלים מסחריים כמו ChatGPT יקרים ומצנזרים תכנים באגרסיביות, ומודלים פתוחים כמו CogVLM התקשו בעבר לתאר תמונות שלא נכנסות להגדרה של תוכן נקי לחלוטין. הוא בנוי בארכיטקטורת Llava ומציע ראייה ממוקדת בתיאור ויזואלי ישיר, כולל תמיכה באמנות דיגיטלית, אנימה ותוכן למבוגרים.

המטרה המוצהרת של המפתח היא להגיע לרמת תיאור קרובה לזו של GPT-4o. המודל מתמקד בזיהוי מדויק של סגנונות, מגדרים, אתניות ופרטים גרפיים מורכבים, בלי להשתמש בלשון נקייה או בביטויים מעורפלים כשהוא נתקל בתמונות נועזות.

מתאים ל

  • תיוג דאטה לדיפיוז'ן

    יצירת פרומפטים ותיאורים מפורטים לאימון מודלי תמונה בלי לעבור ידנית על אלפי קבצים.

  • תיאור תוכן למבוגרים

    זיהוי וקטלוג ישיר של תמונות שכלים מסחריים חוסמים או מצנזרים באופן אוטומטי.

  • אינדוקס אמנות דיגיטלית

    חילוץ מאפיינים גרפיים מדויקים מסגנונות איור, אנימה ודמויות מורכבות.

איפה זה נופל

מדובר בגרסת אלפא מוקדמת, והיוצר מודה במפורש ש־vLLM עלול לעשות בעיות יציבות עם מודלי ראייה. בנוסף, חופש הצנזורה מגיע עם אחריות: אין כאן כמעט סינון תוכן מלבד איסור על חומרים לא חוקיים, כך שלא תרצו להציג את הפלטים שלו ישירות למשתמשי קצה באפליקציה ציבורית בלי שכבת בדיקה משלכם.

שאלות
נפוצות

האם המודל מתאים לצ'אט כללי או רק לתיאור תמונות?

הוא נבנה ומכוונן בעיקר למשימה אחת: הפקת תיאורים טקסטואליים עשירים מתוך תמונות. למרות שהוא משתמש בבסיס שפה של 8.5 מיליארד פרמטרים, הוא לא מיועד להחליף מודל שיחה רב תכליתי.

האם אפשר להריץ אותו על כרטיס מסך ביתי פשוט?

במשקל של 16.6 גיגה בייט בפורמט float32, הוא ידרוש כרטיס עם נפח זיכרון משמעותי, במיוחד תחת vLLM שגוזל משאבים רבים. כרטיסים פשוטים יתקשו להריץ אותו בלי המרה למשקלים מכווצים יותר.

איך מריצים

עם גודל של 8.5 מיליארד פרמטרים ומשקל קבצים של 16.6 גיגה בייט בדיוק float32, תצטרכו כרטיס מסך חזק כדי להחזיק אותו בזיכרון. המפתח ממליץ להריץ אותו דרך vLLM עם ממשק תואם OpenAI, למשל עם הפקודה המגבילה את אורך ההקשר ל־4096 טוקנים כדי לחסוך משאבים.

מודלי ראייה בתוך vLLM רעבים לזיכרון ודורשים כוונון ידני כמו שינוי ניצול הזיכרון או מעבר למצב eager. אם אין לכם חומרה ייעודית עם מספיק VRAM פנוי, עדיף להשתמש בשרת ענן חיצוני או בפתרון מנוהל במקום להיאבק בביצועים מקומיים.

pip install -U huggingface_hub
hf download fancyfeast/llama-joycaption-alpha-two-hf-llava

הרישיון

הרישיון לא דווח בעמוד המודל. המפתח כותב שהוא מתכנן שחרור חופשי ופתוח ללא הגבלות, אבל כל עוד אין קובץ רישיון רשמי ומוגדר, חברות וארגונים לא יכולים להכניס אותו לקוד מסחרי בלי להסתכן משפטית.

הרישיון המלא בעמוד המודל ↗