GPT
L

llama-joycaption-beta-one-hf-llava

קוד פתוח

fancyfeastרישיון לא דווח2025-05-11

  • transformers
  • safetensors
  • llava
  • image-text-to-text
  • captioning

מודל תיאור תמונות פתוח ולא מצונזר שמיועד לתיוג דאטה עבור מודלי דיפוזיה. הוא נותן מענה ישיר למי שצריך תיאורים מפורטים של תוכן מגוון בלי סינונים תאגידיים.

  • 8.5Bפרמטרים
  • 131,072טוקנים בהקשר
  • 15.8 GBמשקל הקבצים
  • 81,067הורדות בחודש

מה זה

מדובר במודל ראייה ושפה שמבוסס על ארכיטקטורת Llava וכולל 8.5 מיליארד פרמטרים. המטרה העיקרית שלו היא לייצר תיאורי תמונה עשירים ומדויקים כדי לאמן מודלים ליצירת תמונות, במקום לשלם על מודלים קנייניים או להסתמך על חלופות חלשות שלא מבינות מגוון רחב של סגנונות.

הייחוד כאן הוא הפתיחות המוחלטת לתוכן ללא צנזורה, עם דגש שווה על תוכן רגיל ותוכן למבוגרים, לצד תמיכה בסגנונות כמו אנימה, אמנות דיגיטלית ופוטוריאליזם. היוצר כיוון לרמת ביצועים קרובה לזו של GPT4o בתחום התיאור, אך בלי לחסום מושגים או לעקוף מונחים בצורה עקיפה ומגוחכת.

מתאים ל

  • תיוג דאטה לדיפוזיה

    יצירת תיאורים מפורטים לתמונות אימון באופן אוטומטי, כדי לשפר איכות של מודלי תמונה.

  • תיאור תוכן למבוגרים

    זיהוי ופירוט תמונות NSFW בלי לחסום מילים או לעצור את הניתוח באמצע.

  • קטלוג סגנונות אמנותיים

    פענוח תמונות אנימה, אמנות דיגיטלית וציורים שדורשים הבנה של סגנונות חזותיים מגוונים.

איפה זה נופל

המודל מוגדר כגרסת בטא, מה שאומר שצריך לצפות לבעיות יציבות ולא להכניס אותו ישירות למוצרים רגישים בלי בדיקה. הכרטיס מודה במפורש שספריית vLLM רעבה מאוד לזיכרון ועלולה להתנהג בצורה לא יציבה עם מודלי תמונה, מה שידרוש מכם התעסקות מתסכלת בפרמטרים כמו ניצול זיכרון וביטול אופטימיזציות מסוימות. בנוסף, אף שהסינון מינימלי וכולל רק חסימה של תוכן בלתי חוקי, אין כאן שום אחריות על מה שהמודל פולט.

שאלות
נפוצות

איזה כרטיס מסך אני צריך בשביל להריץ אותו מקומית?

המשקלים לבדם שוקלים קרוב ל־16 גיגה בייט, כך שכרטיס עם 16 גיגה בייט זיכרון יהיה על הקצה וכנראה ייכשל בהקצאת זיכרון להקשר ולמערכת. כדי להריץ אותו בצורה יציבה בעזרת vLLM בלי לקרוס, כרטיס עם 24 גיגה בייט זיכרון וידאו הוא דרישת הסף המעשית.

האם המודל מוגבל לעבודה באנגלית?

דף המודל מתמקד ביכולות הראייה והתיאור ולא מציין תמיכה רשמית בשפות נוספות כמו עברית. מאחר והמטרה המקורית היא יצירת תיאורים למודלי דיפוזיה שמבוססים בעיקר על אנגלית, כדאי להניח שהפלט המיטבי שלו יהיה באנגלית בלבד.

איך מריצים

כדי להריץ אותו מקומית צריך מאיץ גרפי שמסוגל להחזיק כמעט 16 גיגה בייט של משקלי מודל בדיוק bfloat16, לצד הזיכרון השוטף שמחזיק את ההקשר של התמונה והטקסט. המפתח ממליץ להשתמש בספריית vLLM עבור ביצועים גבוהים, שמציגה גם ממשק תואם OpenAI, אך מציין שהרצת מודלי ראייה בסביבה הזו דורשת כוונון ידני של זיכרון והגבלת אורך ההקשר.

אם אין לכם כרטיס עם לפחות 24 גיגה בייט של זיכרון וידאו פנוי, ההרצה העצמית תהיה איטית ומקרטעת, ובמצב כזה עדיף לשכור מופע ייעודי בענן שכולל חומרה מתאימה להרצה ישירה דרך vLLM.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="fancyfeast/llama-joycaption-beta-one-hf-llava")
print(pipe("שלום"))

הרישיון

היוצר לא הגדיר רישיון רשמי בעמוד המודל, למרות שהוא כותב בתיאור שהמשקלים חופשיים ופתוחים ללא הגבלות. כל עוד אין קובץ רישיון משפטי מחייב, חברות וארגונים לא יכולים להשתמש בו במוצר מסחרי בצורה בטוחה, כי מבחינה חוקית היעדר רישיון משאיר את כל הזכויות שמורות.

הרישיון המלא בעמוד המודל ↗