GPT
T

thesby_Qwen2.5-VL-7B-NSFW-Caption-V3-GGUF

קוד פתוח

bartowskiapache-2.02025-07-09

  • gguf
  • qwen
  • qwen2.5-vl
  • image-captioning
  • multimodal

גרסת GGUF שעברה כיול לחילוץ תיאורי תמונה בוטים ותכני מבוגרים בלי סינונים. היא מתאימה למי שבונה קטלוג או מאמן מודלי תמונה וצריך תיוג מדויק של תוכן ששרתי ענן מסחריים חוסמים מיד.

  • 114 GBמשקל הקבצים
  • 25,392הורדות בחודש
  • 71לייקים

מה זה

מדובר בהמרה של thesby לפורמט GGUF באמצעות llama.cpp, על בסיס מודל הראייה Qwen2.5-VL בגודל 7B פרמטרים. ההתאמה כאן מתמקדת במשימה בודדת: קבלת תמונה והחזרת תיאור טקסטואלי מפורט, במיוחד בתחום של תוכן מבוגרים (NSFW).

בניגוד למודלי ראייה סטנדרטיים שכוללים מעצורי בטיחות ומסרבים לנתח עירום או מצבים אינטימיים, הגרסה הזו אומנה לתאר בדיוק מה מופיע בפריים. תהליך ההמרה של bartowski כולל שימוש ב־imatrix לכיול, מה שמצמצם את אובדן המידע ומאפשר להריץ את המודל ביעילות על חומרה מקומית. הדגש פה הוא על שפות אנגלית וסינית בלבד.

מתאים ל

  • תיוג דאטה לאימון תמונה

    יצירת כתוביות (captions) עשירות לתמונות עירום כהכנה לאימון מודלי LoRA בלי צנזורה.

  • סינון וסיווג תוכן מקומי

    זיהוי ופירוט תכנים רגישים על שרת פנימי, בלי לחשוף תמונות פרטיות ל־API חיצוני.

  • קטלוג מאגרי מדיה

    הפקת מטא-דאטה טקסטואלי מפורט למאגרי תמונות מבוגרים באנגלית ובסינית.

איפה זה נופל

המודל מיועד כמעט אך ורק לתיאור תמונות ולא יעבוד טוב כעוזר שיחה כללי או לפתרון בעיות מורכבות. הוא תומך רשמית באנגלית ובסינית בלבד, כך שניסיון להוציא ממנו תיאורים בעברית ייכשל או יניב טקסט משובש. בנוסף, בגרסאות מכווצות מאוד כמו Q2_K או IQ2 יש ירידה מורגשת ביכולת לקלוט פרטים קטנים בתמונה, ועלולות להופיע הזיות בתיאור.

שאלות
נפוצות

האם המודל יודע לענות ולהפיק תיאורים בעברית?

לא. המודל אומן ותומך רשמית באנגלית ובסינית בלבד. אם תזינו הנחיות בעברית הוא כנראה לא יבין את ההקשר, ולכן מומלץ לעבוד באנגלית ולתרגם את הפלט בנפרד במידת הצורך.

איזה קובץ הכי כדאי להוריד מתוך הרשימה?

ההמלצה הכללית היא thesby_Qwen2.5-VL-7B-NSFW-Caption-V3-Q4_K_M.gguf. הוא שוקל 4.68 גיגה-בייט, שומר על איזון מוצלח בין מהירות לאיכות תיאור, ונכנס בנוחות בזיכרון של כרטיסי מסך סטנדרטיים.

איך מריצים

כדי להריץ אותו מקומית צריך את llama.cpp מגרסה b5849 ומעלה, או ממשק כמו LM Studio. הגרסה המאוזנת לרוב האנשים היא Q4_K_M במשקל 4.68 גיגה-בייט, שרצה מעולה על כרטיס מסך עם 8 עד 12 גיגה-בייט זיכרון גרפי (VRAM). אם יש לכם כרטיס של 16 גיגה-בייט ומעלה, אפשר לקחת את Q6_K או Q8_0 לשמירה מקסימלית על איכות הזיהוי.

מי שמוגבל במשאבים יכול לרדת לגרסאות ה־IQ כמו IQ3_M (3.57 גיגה-בייט) שנותנות תוצאה סבירה ביחס לגודל, אבל דורשות מעבד גרפי של Nvidia או AMD כדי לא לסבול מביצועים איטיים. הרצה עצמית כאן עדיפה בעיקר בגלל סוג התוכן, מאחר שמרבית שירותי ה־API המסחריים יחסמו בקשות כאלו על הסף.

ollama run hf.co/bartowski/thesby_Qwen2.5-VL-7B-NSFW-Caption-V3-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

29 קבצים במאגר, 114 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון המדווח הוא Apache 2.0, שמאפשר שימוש חופשי, שינוי קוד והפצה מסחרית ללא תמלוגים, בכפוף למתן קרדיט וצירוף עותק הרישיון. עם זאת, יש לקחת בחשבון את תנאי הבסיס של מודל Qwen המקורי ואת מגבלות החוק המקומי בנוגע להפצה ואחסון של תכנים גרפיים למבוגרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗