GPT
Q

Qwen2.5-VL-7B-Instruct-abliterated

קוד פתוח

huihui-aiapache-2.02025-02-17

  • transformers
  • safetensors
  • qwen2_5_vl
  • image-text-to-text
  • multimodal

גרסה נטולת סינונים של מודל הראייה והטקסט הפופולרי, שמחזירה תשובות בלי לחסום פרומפטים שנויים במחלוקת. מיועד למי שרוצה ניתוח תמונות וטקסט בלי סירובים אוטומטיים מובנים.

  • 8.3Bפרמטרים
  • 128,000טוקנים בהקשר
  • 15.5 GBמשקל הקבצים
  • 18,001הורדות בחודש

מה זה

מדובר במודל מולטימודלי שמקבל תמונות לצד טקסט ומייצר טקסט, המבוסס על הארכיטקטורה של עליבאבא בגודל שמונה מיליארד פרמטרים. ההבדל המרכזי מול מודל הבסיס המקורי הוא תהליך ההסרה של מנגנוני הסירוב הפנימיים שלו, מה שנקרא abliteration. היוצרים שלו שינו את המשקלים כדי שהוא לא ידחה בקשות של משתמשים.

ההתערבות הזו בוצעה אך ורק בחלק הטקסטואלי של המודל, ולא ברכיב הראייה עצמו. הוא שומר על היכולת לעבד הקשר של מאה עשרים ושמונה אלף טוקנים, אבל עכשיו הוא יענה על שאלות שגרסאות רשמיות נוטות לחסום מראש, בלי המעצורים הרגילים שמגיעים עם מודלי שיחה מסחריים.

מתאים ל

  • ניתוח מסמכים רגישים

    מאפשר לעבד תמונות וטקסט בלי חשש שהמודל יסרב לענות בגלל מילות מפתח תמימות.

  • מחקר על התנהגות מודלים

    מתאים לבדיקות השוואתיות של ביצועים לפני ואחרי הסרת מנגנוני הבטיחות הפנימיים.

  • חילוץ מידע מתמונות

    מריץ עיבוד מקומי מולטימודלי על חומרה עצמאית בלי תלות ברשת חיצונית.

איפה זה נופל

ההתערבות ברכיבי הטקסט עלולה לפגוע ביציבות התשובות, בהיגיון הפנימי ובדיוק המקורי של המודל. בנוסף, הכרטיס מציין במפורש שהשינוי נעשה רק בחלק הטקסטואלי ולא ברכיב הראייה, כך שרמת ההבנה החזותית עשויה להתנהג בצורה שונה ממה שמצפים. חובה לבדוק אותו מול מקרים אמיתיים כדי לוודא שהוא לא מייצר הזיות מוגברות או פלט משובש במקום שבו המקור היה יציב.

שאלות
נפוצות

האם המודל שונה ביכולת ניתוח התמונות שלו ממודל הבסיס?

היוצרים מציינים שהשינוי בוצע רק בחלק של הטקסט ולא בחלק של הראייה. בפועל, החיבור בין השניים קובע את התשובה הסופית, ולכן כדאי לבדוק ביצועים מול נתונים אמיתיים שלכם.

האם הוא מבין עברית?

הכרטיס מדווח על אנגלית בלבד כשפה נתמכת. ייתכן שהוא יגיב במידה מסוימת לעברית בגלל נתוני האימון המקוריים, אך הוא לא נבדק או הותאם לכך רשמית.

איך מריצים

כדי להריץ אותו מקומית בפורמט המקורי תצטרכו כרטיס מסך עם לפחות עשרים ג׳יגה זיכרון גרפי, בהתחשב בנפח קבצים של חמישה עשר וחצי ג׳יגה בפורמט bfloat16. המפתחים מציעים גם גרסה מוכנה לשימוש מהיר דרך ollama עם הפקודה ollama run huihui_ai/qwen2.5-vl-abliterated:7b, שחוסכת התעסקות בספריות פייתון.

אם יש לכם כרטיס חלש יותר בלי מספיק זיכרון ייעודי, תצטרכו להשתמש בקוונטיזציה או לפנות לשרת מרוחק. הרצה מקומית משתלמת כאן בעיקר למי שרוצה פרטיות מלאה או שחייב מודל שלא מסרב לענות, דברים שאי אפשר לקבל דרך ממשקים סגורים ברשת.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="huihui-ai/Qwen2.5-VL-7B-Instruct-abliterated")
print(pipe("שלום"))

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי קוד והפצה חופשית. אתם יכולים לשלב אותו במוצרים שלכם, בתנאי שאתם שומרים על תנאי הרישיון המקוריים ונותנים קרדיט.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗