GPT
Q

Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF

קוד פתוח

0bserverxapache-2.02026-08-14

  • transformers
  • gguf
  • qwen3.8
  • qwen3.5
  • heretic

גרסה שעברה הסרת מגבלות כפולה כדי לענות על שאלות שמודלים רגילים מסרבים לגעת בהן. היא שומרת על היכולות המקוריות של המודל כמעט בלי לפגוע באיכות הפלט.

  • 1.5 TBמשקל הקבצים
  • 1,605,890הורדות בחודש
  • 428לייקים

מה זה

במקום להחסיר וקטור סירוב בודד ולפגוע בהתנהגות הכללית, היוצרים השתמשו באופטימיזציית מטריצות שלוש פעמים ברציפות כדי לנטרל את מנגנוני החסימה. התוצאה היא צניחה משיעור סירובים של תשעים ותשעה אחוזים במודל המקורי לאפס עד אחוז בודד במבחן של מאה בקשות מזיקות, תוך שמירה על ציון התרחקות של 0.0085 בלבד מהמקור, מה שמבטיח שהידע וההיגיון לא נשחקו.

הבסיס הוא ארכיטקטורה היברידית של 27 מיליארד פרמטרים שמשלבת שכבות קשב רגילות עם שכבות ליניאריות מסוג DeltaNet. הוא תומך בהקשר של עד 262,144 טוקנים, מגיע מוכן בפורמט שמתאים ישירות להרצה מקומית, וכולל קובצי כיול שמחלקים את דיוק הביטים גם לקוד, חשיבה ושפות שונות ולא רק לאנגלית.

מתאים ל

  • כתיבה יצירתית ללא סינונים

    יצירת טקסטים ומשחקי תפקידים למבוגרים שנתקלים בדרך כלל בחסימות תוכן במודלים מסחריים רגילים.

  • מחקר אבטחת מידע

    בדיקת תרחישי תקיפה וקוד זדוני בסביבה מקומית ומבוקרת בלי לקבל סירובים אוטומטיים מהמערכת.

  • מענה טכני וניתוח קוד

    שילוב בפיתוח שדורש שמירה על היגיון מורכב בעזרת כיול רב לשוני שמתעדף מבני קוד והסקה.

איפה זה נופל

ההסרה אינה מוחלטת, והיוצרים השאירו בכוונה חסימה על הנחיות ליצירת נשק כימי להשמדה המונית. בנוסף, גרסאות הדחיסה הנמוכות ביותר כמו IQ2 ו־IQ1 מציגות פגיעה ברורה באיכות הטקסט, ומנגנון ה־MTP שנועד להאיץ את היצירה עלול לגרום להאטה כבדה בגרסאות אלו במקום לרווח ביצועים.

שאלות
נפוצות

האם צריך להוריד את כל 110 הקבצים שמופיעים במאגר?

ממש לא, המאגר מחזיק קבצים שונים עבור כל רמת דחיסה ושוקל מעל טרה בייט וחצי במצטבר. אתם צריכים להוריד קובץ אחד בלבד שמתאים לזיכרון של כרטיס המסך שלכם, כשההמלצה היא לבחור קובץ מסדרת multilingual.

מה ההבדל בין הקבצים הרגילים לקובצי mtp?

קובצי mtp מכילים ראש חיזוי מובנה שנועד להאיץ את מהירות הפקת הטקסט על גרסאות תואמות, בתוספת של כ־451 מגה בייט לנפח. המהירות לא מובטחת בכל חומרה, ובגרסאות דחוסות מאוד כמו IQ1_M המדידות הראו שהיא דווקא פוגעת בביצועים.

איך מריצים

כרטיס מסך של 24 גיגה בייט הוא נקודת הפתיחה המעשית לקובץ ברירת המחדל RVN-Q4_K_M-multilingual ששוקל 15.41 גיגה בייט נטו, כי צריך להשאיר מקום לזיכרון המערכת ולחלון ההקשר. על כרטיסי 16 גיגה עדיף לרדת לגרסת Q3_K_S שלוקחת 11.24 גיגה בייט, ובמחשבי אפל או מעבדים רגילים צריך לוודא שנשארים לפחות 6 עד 10 גיגה בייט פנויים בזיכרון המאוחד מעבר למשקל הקובץ.

קיימות גם גרסאות עם תוספת MTP שמגדילה את הנפח בערך ב־451 מגה בייט לצורך האצת פענוח, אבל בגרסאות דחיסה קיצוניות כמו IQ1_M היא מאטה את הקצב בשישים אחוז. אם אין לכם חומרה ייעודית מקומית עם לפחות 16 עד 24 גיגה בייט זיכרון גרפי פנוי, עדיף לפנות לשרת מרוחק במקום לנסות לכווץ את המודל לגרסאות נמוכות שמאבדות מאיכותן.

ollama run hf.co/0bserverx/Qwen3.8-27B-Heretic-Abliterated-Uncensored-GGUF:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0 שמאפשר שימוש מסחרי, שינוי קוד והפצה חופשית לכל מטרה. התנאי המרכזי הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי בקבצים שאתם מפיצים. הוא מתאים לשילוב ישיר במוצרים מסחריים בלי דרישה לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗