GPT
L

llama-joycaption-beta-one-hf-llava-mmproj-gguf

קוד פתוח

concedoרישיון לא דווח2025-05-15

  • gguf
  • endpoints_compatible
  • conversational

הפצה מקומית בפורמט GGUF של Joycaption לתיאור תמונות. המטרה כאן היא להריץ מודל ראייה ישירות דרך KoboldCpp בלי להסתמך על שירותי ענן.

  • 28.3 GBמשקל הקבצים
  • 13,073הורדות בחודש
  • 74לייקים

מה זה

מדובר בגרסאות מכווצות של Joycaption Beta One, שמבוסס על פרויקט המקור של fancyfeast ומומר לשימוש בסביבת KoboldCpp מגרסה 1.91 ומעלה. המודל מתמקד במשימה אחת מרכזית, והיא קריאת תמונות ויצירת תיאורים מפורטים עבורן, במבנה של שילוב בין מודל שפה לבין רכיב ראייה נפרד.

במקום לקבל קובץ יחיד, המבנה מבוסס על ארכיטקטורת LLaVA שמחייבת טעינה של שני קבצים במקביל: מודל הטקסט הראשי וקובץ הראייה הנלווה. החבילה כוללת שלושה קוונטים שונים של מודל הטקסט יחד עם קובץ הפרויקציה, כך שניתן לבחור את רמת הדחיסה שמתאימה לזיכרון שלכם במחשב האישי.

מתאים ל

  • תיאור תמונות מקומי

    יצירת כיתובים ותיאורים מפורטים לתמונות ישירות על החומרה שלכם, בלי להוציא מידע לרשת.

  • תיוג דאטה מקומי

    מעבר על תיקיות תמונות במחשב כדי להפיק תיאורי טקסט לצורכי אימון מודלים אחרים.

  • עבודה אופליין בקו kobold

    הרצה ישירה דרך ממשק KoboldCpp בגרסה 1.91 ומעלה למי שכבר רגיל לעבוד בסביבה הזו.

איפה זה נופל

היוצר לא פרסם שום מבחני ביצועים, מדדים רשמיים או תיעוד של כשלים ידועים. בנוסף, חובה לטעון שני קבצים נפרדים בגרסה מדויקת של KoboldCpp, ואם מפספסים את החיבור של קובץ הראייה שום דבר לא יעבוד. מומלץ לבדוק היטב איך הוא מתמודד עם תמונות מורכבות לפני שמשלבים אותו בפרויקט.

שאלות
נפוצות

חייבים להוריד את כל 28 הגיגה בייט?

ממש לא. מורידים רק קוונט אחד של מודל הטקסט, למשל Q4_K, ואת קובץ הראייה F16. שאר הקבצים הם פשוט אפשרויות כיווץ אחרות לאותו מודל.

למה המודל לא מזהה תמונות אחרי הטעינה?

ברוב המקרים זה קורה כי שכחתם לטעון את קובץ הראייה הנפרד. המערכת דורשת להגדיר גם את קובץ הטקסט וגם את קובץ הפרויקציה בלשונית המתאימה.

אפשר להשתמש בו בתוך מוצר מסחרי?

כרגע אין בעמוד שום מידע על רישיון. במצב כזה לא כדאי להכניס אותו לשום מוצר עסקי עד שהיוצר יבהיר את תנאי השימוש.

איך מריצים

כדי להריץ אותו, מורידים את קובץ הטקסט הראשי, למשל בגרסת Q4_K, ואת קובץ הראייה בפורמט F16. פותחים את KoboldCpp, נכנסים ללשונית הטעינה, ומגדירים את הקובץ הראשון כמודל טקסט ואת השני כרכיב הראייה.

סך כל הקבצים שפורסמו שוקל 28.3 גיגה בייט, אבל אתם מורידים רק זוג קבצים אחד לפי כרטיס המסך שלכם. אם אין לכם חומרה מקומית סבירה או שאתם לא רוצים להסתבך עם הגדרות טעינה כפולות, שירות API חיצוני יעשה עבודה פשוטה יותר.

ollama run hf.co/concedo/llama-joycaption-beta-one-hf-llava-mmproj-gguf:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

היוצר לא ציין שום רישיון בעמוד המודל. מבחינה משפטית, כשאין רישיון מוגדר אסור להניח שמותר להשתמש בו לצרכים מסחריים, ואי אפשר לשלב אותו במוצר בלי לקחת סיכון של הפרת זכויות יוצרים.

הרישיון המלא בעמוד המודל ↗