GPT
Q

Qwen2.5-VL-7B-Abliterated-Caption-it-GGUF

קוד פתוח

mradermacherapache-2.02025-07-23

  • transformers
  • gguf
  • text-generation-inference
  • uncensored
  • image-captioning

גרסת GGUF שעברה הסרת מגבלות ומיועדת לתיאור תמונות. היא מתאימה למי שרוצה להריץ מודל חזותי מקומית בלי סינונים על התוכן.

  • 65.5 GBמשקל הקבצים
  • 4,815הורדות בחודש
  • 77לייקים

מה זה

מדובר בהמרה סטטית לפורמט GGUF של מודל ראייה ושפה בגודל שבעה מיליארד פרמטרים, שמבוסס במקור על עבודה של prithivMLmods. המודל מתמקד במשימות של תמונה לטקסט, בעיקר ייצור כתוביות ותיאורים מפורטים, כשהוא עבר תהליך הסרת מגבלות שמונע ממנו לסרב לבקשות סביב תכנים רגישים.

ההבדל המרכזי מול מודלים רגילים באותו סדר גודל הוא השילוב בין הסרת החסימות להתאמה למשימות תיאור ויזואלי. במקום מודל כללי שמסרב לנתח תמונות מסוימות, מקבלים כאן כלי שמגיב ישירות ומפרט מה הוא רואה, כשהדגש בכרטיס הוא על אספקת קבצים מכווצים שמתאימים למגוון רחב של משאבי חומרה.

הכרטיס לא כולל ציוני מבחנים רשמיים, אלא מפנה להשוואות כלליות על איבוד דיוק בכימותים שונים. המשמעות בפועל היא שרמת הדיוק תלויה בגרסה שתבחרו להוריד, החל מגרסאות שחותכות במשקל אבל פוגעות באיכות השפה, ועד לקבצים כבדים ששומרים כמעט על מלוא היכולת המקורית.

מתאים ל

  • תיאור תמונות ללא סינון

    מתאים לניתוח מאגרי תמונות שכוללים תוכן שהיה גורם למודלים מסחריים רגילים לסרב להגיב.

  • תיוג תמונות באופליין

    מאפשר לעבד קטלוגים מקומית על מחשב פיתוח רגיל באמצעות קובצי כימות קלים.

  • יצירת דאטה־סטים לאימון

    מספק כתוביות מפורטות באנגלית לתמונות עבור אימון מודלים אחרים ללא תלות ברשת.

איפה זה נופל

המודל מצהיר על תמיכה באנגלית, סינית ותאילנדית בלבד, כך שעברית לא נתמכת כאן באופן רשמי. בנוסף, הסרת המגבלות אומרת שאין שום מנגנון הגנה פנימי מפני ייצור טקסט בעייתי או פוגעני, מה שמחייב אתכם לבנות שכבת סינון משלכם אם הכלי נחשף למשתמשי קצה. נקודה טכנית נוספת היא שמדובר בכימות סטטי רגיל ולא בכימות מבוסס מטריצת חשיבות, ולכן בגרסאות הנמוכות ביותר הירידה באיכות תהיה מורגשת למדי.

שאלות
נפוצות

למה יש שני קבצים שונים להורדה כדי להפעיל אותו?

מודלים חזותיים מהסוג הזה דורשים קובץ נפרד עבור מפענח התמונה שנקרא פרויקטור, בנוסף לקובץ של מודל השפה. בלי להוריד את קובץ המולטימודל המשלים, התוכנה לא תדע לחבר בין התמונה לטקסט.

האם המודל יבין הנחיות שכתובות בעברית?

הכרטיס מפרט תמיכה בשלוש שפות בלבד, אנגלית, סינית ותאילנדית. הוא לא אומן לעבוד בעברית, ולכן ניסיונות לעבוד איתו בשפה הזו צפויים להניב טעויות או ג'יבריש.

איך מריצים

כדי להריץ אותו צריך להוריד שני קבצים נפרדים, קובץ המשקולות עצמו וקובץ הפרויקטור החזותי ששוקל בין ג'יגה בייט אחד לגיגה וחצי. גרסאות הכימות נעות מגרסת שתי ביט במשקל שלושה נקודה אחד ג'יגה בייט ועד לקובץ המלא במשקל חמישה עשר נקודה שלושה ג'יגה בייט. המפתח ממליץ על גרסאות ארבע ביט ששוקלות סביב ארבעה וחצי ג'יגה בייט כאיזון נכון בין מהירות לאיכות.

אם יש לכם מחשב עם שמונה עד שישה עשר גיגה זיכרון בכרטיס המסך, תוכלו להריץ את הגרסאות המומלצות מקומית בלי בעיה דרך ספריות תומכות. אם מדובר במשימה חד פעמית או שאין לכם כרטיס מתאים, שירות חיצוני חוסך את ההתעסקות בהורדת קבצים כבדים וחיבור רכיב הראייה.

ollama run hf.co/mradermacher/Qwen2.5-VL-7B-Abliterated-Caption-it-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא אפאצ'י שתיים אפס. זה רישיון פתוח ומתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה חופשית בתוך מוצרים. הדרישה העיקרית היא לצרף עותק של הרישיון המקורי ולתת קרדיט למפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗