GPT
Q

Qwen3-VL-8B-Instruct-abliterated-v2.0-GGUF

קוד פתוח

mradermacherapache-2.02025-11-10

  • transformers
  • gguf
  • text-generation-inference
  • abliterated
  • v2.0

גרסת קוונטיזציה של מודל ראייה ושפה בגודל שמונה מיליארד פרמטרים, שעבר הסרה של מגבלות סירוב. מיועד למי שרוצה לעבד תמונות וטקסט מקומית בלי צנזורה מובנית.

  • 70.2 GBמשקל הקבצים
  • 9,759הורדות בחודש
  • 61לייקים

מה זה

המאגר הזה מציע המרות סטטיות בפורמט GGUF למודל הראייה והשפה של Qwen, בגרסה שעברה תהליך של הסרת מגבלות הבטיחות והסירובים הרגילים. המודל מתמחה בהבנת תמונות לצד הוראות טקסט באנגלית, ומאפשר לקבל תשובות גם על בקשות שמודלים מסחריים רגילים נוטים לדחות או לצנזר.

בגודל של שמונה מיליארד פרמטרים, הוא מספק נקודת איזון נוחה בין דיוק ביצועים לבין דרישות זיכרון שפויות יחסית. מפרסם החבילה לא צירף מבחני ביצועים ספציפיים משלו, אלא התמקד באספקת מגוון רחב של דחיסות, כך שכל אחד יכול לבחור את רמת הפשרות בין איכות התוצאה לבין מהירות וצריכת משאבים.

מתאים ל

  • ניתוח תמונות לא מצונזר

    מאפשר לעבד ולתאר תמונות שנדחות במערכות סגורות עקב מנגנוני סינון מחמירים מדי.

  • חילוץ מידע רגיש מתמונות

    הרצה מקומית מלאה שמתאימה לסריקת מסמכים גרפיים בלי לשלוח מידע החוצה לרשת.

  • שרת ראייה מקומי לחומרה זולה

    בגרסת 4 ביט הוא דורש כחמישה גיגה זיכרון בלבד, מה שמתאים לכרטיסי מסך ביתיים.

איפה זה נופל

המודל מוגדר רשמית רק עבור אנגלית, כך שאין לצפות ממנו להבנה אמינה של תמונות עם טקסט בעברית או מתן תשובות ברורות בשפה המקומית. בנוסף, הסרת מגבלות הבטיחות הופכת אותו לבלתי צפוי, מה שאומר שהוא עלול לייצר תכנים בעייתיים או הזיות ללא שום מנגנון ריסון פנימי. קיימות גם גרסאות דחוסות מאוד כמו שתי ביט שמציגות ירידה חדה באיכות, ולכן הן לא מתאימות לשימוש מעשי.

שאלות
נפוצות

למה צריך להוריד שני קבצים בשביל להריץ אותו?

מודלים מולטימודאליים בפורמט הזה דורשים קובץ נפרד למשקלי השפה וקובץ משלים שמחבר את רכיב עיבוד התמונה אל המודל. בלי להוריד את אחד מקבצי הראייה המיוחדים, המודל לא יצליח לקרוא או לעבד קבצים גרפיים.

איזו גרסה כדאי להוריד מתוך הרשימה?

עבור רוב המשתמשים, גרסת Q4_K_M בנפח של קצת מעל חמישה גיגה מספקת את השילוב הנכון ביותר בין מהירות ריצה לאיכות הפלט. גרסאות נמוכות משלוש ביט גורמות לירידה מורגשת באיכות, ואילו גרסת f16 נחשבת לבזבוז משאבים מוגזם ביחס לתמורה.

איך מריצים

כדי להריץ אותו עם יכולות ראייה, חייבים להוריד שני קבצים נפרדים: קובץ המודל העיקרי וקובץ משלים של פרויקט המולטימודאל, ששוקל בין 0.9 ל־1.3 גיגה בייט. קבצי המודל עצמם נעים בין 3.4 גיגה בגרסת שתי ביט ועד 16.5 גיגה בגרסת f16 מלאה, כאשר היוצר ממליץ על גרסאות Q4_K_M בנפח 5.1 גיגה כאיזון המומלץ והמהיר ביותר.

המשמעות היא שכרטיס מסך מודרני עם 8 עד 12 גיגה בייט של זיכרון יחזיק את המודל בלי בעיה. אם המטרה היא סתם לשלוח תמונה מדי פעם בלי לתחזק שרת מקומי, API מסחרי יהיה זול ופשוט יותר, אבל למי שחייב פרטיות מוחלטת או פעולה ללא סירובים, ההרצה העצמאית הכרחית.

ollama run hf.co/mradermacher/Qwen3-VL-8B-Instruct-abliterated-v2.0-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט רשום תחת רישיון אפאצ'י 2.0. הרישיון הזה מאפשר שימוש חופשי לגמרי, כולל שילוב במוצרים מסחריים, שינוי הקוד והפצה, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗