GPT
L

llama-joycaption-beta-one-hf-llava-GGUF

קוד פתוח

mradermacherרישיון לא דווח2025-05-14

  • transformers
  • gguf
  • captioning
  • en
  • endpoints_compatible

גרסת קוונטיזציה בפורמט GGUF למודל התיאור הוויזואלי JoyCaption Beta One. היא מיועדת למי שרוצה לייצר תיאורים מפורטים לתמונות מקומית על המחשב בלי לשלוח מידע החוצה.

  • 66.9 GBמשקל הקבצים
  • 7,247הורדות בחודש
  • 49לייקים

מה זה

המאגר מכיל המרות מכווצות של מודל המבוסס על LLaVA ו־Llama, שפותח במקור בידי fancyfeast במטרה לחלץ תיאורים עשירים ומפורטים מאוד מתמונות. בניגוד למודלי ראייה כלליים שמסתפקים בזיהוי אובייקטים בסיסי, הדגש כאן הוא על ניתוח עומק של קומפוזיציה, סגנון אמנותי, תאורה ופרטים זעירים, שמתאימים במיוחד לבניית דאטה־סטים ואימון מודלי יצירת תמונה.

המשתמש mradermacher לקח את משקולות המקור והמיר אותן לפורמט GGUF סטטי במגוון רמות דחיסה, מה שמאפשר להריץ אותו דרך מנועים קלים מבוססי llama.cpp. המשקלים נעים בין קבצים קטנים של 3.3 גיגה־בייט ועד גרסת הדיוק המלא בנפח 16.2 גיגה־בייט. אין כאן שינוי בארכיטקטורה אלא התאמה טכנית בלבד שנועדה לחסוך זיכרון ולשפר ביצועים על חומרה צרכנית רגילה.

מתאים ל

  • תיוג תמונות לאימון מודלים

    הפקת תיאורי טקסט ארוכים ומפורטים לציורים ותמונות, שנועדו ישירות לאימון מודלים של מחוללי תמונה.

  • ניתוח ויזואלי מקומי ומאובטח

    זיהוי תוכן תמונות רגישות על גבי תחנת עבודה סגורה, ללא תלות ברשת וללא חשש מדליפת מידע.

  • בניית קטלוג פנימי לתמונות

    חילוץ אוטומטי של תיאורים מדויקים עבור ארכיונים ומאגרי תמונות גדולים בשפה האנגלית.

איפה זה נופל

הקובץ כולל רק המרות סטטיות ולא quants מסוג imatrix, מה שאומר שבגרסאות הדחוסות ביותר, כמו Q2_K או Q3, יש פגיעה מורגשת באיכות הפלט וההבנה הוויזואלית. בנוסף, המודל אומן ויודע לעבוד באנגלית בלבד. אם אתם צריכים תיאורים בעברית או ממשק בשפות אחרות, המודל הזה פשוט יחזיר ג'יבריש או שגיאות, ותצטרכו לתרגם את הפלט בעזרת מודל נפרד.

שאלות
נפוצות

האם המודל תומך בתמונות וטקסט בעברית?

לא, המודל מוגדר ומאומן לעבודה באנגלית בלבד. כל פרומפט או ניסיון לקבל ממנו תיאור בעברית יפיק תוצאות לקויות, ולכן תצטרכו להעביר את הפלט תרגום חיצוני.

איזו גרסה מומלץ להוריד מתוך הרשימה?

לרוב המשתמשים כדאי לקחת את Q4_K_M ששוקלת 5.0 גיגה ומציעה איזון מצוין בין מהירות לאיכות. מי שמחזיק כרטיס מסך חזק יותר יכול לקחת את Q8_0 או Q6_K.

איך מריצים אותו יחד עם תמונות?

צריך מנוע הרצה מבוסס llama.cpp שתומך בקבצי GGUF וגם במודלי LLaVA, יחד עם קובץ ה־mmproj המתאים שמאפשר לנתח את פיקסלי התמונה במקביל למשקולות הטקסט.

איך מריצים

בשביל להריץ את המודל צריך כלי שתומך בפורמט GGUF יחד עם תמיכה במודלי ראייה של LLaVA. הגרסאות המומלצות לשימוש יומיומי הן Q4_K_M בנפח 5.0 גיגה־בייט או Q4_K_S בנפח 4.8 גיגה־בייט, שרצות חלק על כרטיסי מסך ביתיים עם 8 גיגה זיכרון וידאו, ואפילו על מעבד בלבד ללא מאיץ גרפי ייעודי.

אם יש לכם כרטיס עם 12 גיגה זיכרון ומעלה, אפשר לבחור בגרסת Q6_K או Q8_0 כדי לקבל דיוק מרבי בלי לפגוע בהבנת הפרטים הקטנים. למי שאין לו כרטיס מסך מתאים ורוצה לתאר מיליוני תמונות במהירות, פנייה לשירות מנוהל בענן עדיין תהיה מהירה יותר מתור מקומי על מעבד.

ollama run hf.co/mradermacher/llama-joycaption-beta-one-hf-llava-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון של הקבצים האלה לא דווח בדף המודל, וגם תנאי השימוש של מודל המקור לא צוינו שם. אם אתם מתכננים לשלב אותו במוצר מסחרי, מדובר בסיכון משפטי ברור. מומלץ לבדוק קודם את הרישיון של המודל המקורי של fancyfeast לפני שמשתמשים בו מחוץ לניסויים אישיים.

הרישיון המלא בעמוד המודל ↗