GPT
Q

Qwen3.8-27B-Uncensored-GGUF

קוד פתוח

JonathanColettiapache-2.02026-08-14

  • llama.cpp
  • gguf
  • uncensored
  • qwen3.8
  • mtp

גרסת קוונטיזציה פתוחה שמסירה את רוב מנגנוני הסירוב של מודל הבסיס תוך שמירה על ראש החיזוי המהיר. היא מיועדת למי שרוצה ביצועים בלי צנזורה על חומרה מקומית.

  • 215 GBמשקל הקבצים
  • 2,660,078הורדות בחודש
  • 1,042לייקים

מה זה

מדובר בהסבת GGUF למודל Qwen3.8 בגודל 27 מיליארד פרמטרים, שעבר תהליך הסרת סירובים באמצעות שינוי משקולות ישיר וללא אימון מחדש. הייחוד העיקרי כאן לעומת הסבות רגילות הוא שמירת שכבת ה־MTP, שמאפשרת פענוח ספקולטיבי מובנה ומאיצה את קצב יצירת הטקסט בלי צורך במודל טיוטה חיצוני נפרד.

במבחני השוואה מול מודל הבסיס, ההתערבות במשקולות עלתה בירידה ממוצעת זניחה של 0.5 נקודות במבחני ידע כללי כמו MMLU ו־HellaSwag. מבחינת סירובים, המודל ענה על 88 מתוך 100 פרומפטים מזיקים שנבדקו, לעומת מודל המקור שסירב ל־98 מהם. קבצי הקוונטיזציה נעים מ־IQ2_M ועד Q8_0, כאשר מדדי הפרפלקסיטי מראים שרוב הגרסאות מ־IQ4_XS ומעלה שומרות כמעט לחלוטין על דיוק המקור, בעוד שגרסת 2 ביט מציגה פגיעה מורגשת יותר באיכות.

מתאים ל

  • עבודה מול טקסט רגיש

    ניתוח מסמכים או חומרי גלם שמפעילים אזעקות שווא במודלים מצונזרים רגילים.

  • הסקה מהירה מקומית

    שימוש בראש ה־MTP המובנה כדי לחלץ קצב טוקנים גבוה בלי לחבר מודל עזר.

  • משימות ראייה ב־ComfyUI

    חיבור קובץ ה־mmproj הכלול לעיבוד תמונות וטקסט בשרת גרפי מקומי.

איפה זה נופל

הסירובים לא נעלמו לגמרי. המודל עדיין חוסם כ־12 אחוז מהבקשות הבעייתיות, וההתנהגות שלו סביב גבולות התוכן פחות יציבה וצפויה מזו של מודל הבסיס. המדידות נערכו כשרכיב החשיבה הפנימית מנוטרל, כך שבשיחה רגילה עם תגי חשיבה פעילים אחוזי הסירוב יכולים להשתנות.

הבדיקות בכרטיס לא כללו יכולות תכנות, מתמטיקה או שפות שאינן אנגלית, ולכן צריך לבדוק היטב ביצועים בעברית לפני שילוב שלו במערכת. בגרסאות הנמוכות, במיוחד IQ2_M, הפגיעה במשקולות מחמירה את חוסר היציבות של התשובות.

אותה משפחה

Qwen3.8-27B-Uncensored יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזו גרסה כדאי להוריד מתוך הרשימה?

עבור רוב השימושים, Q4_K_M או IQ4_XS נותנות את היחס הטוב ביותר בין צריכת זיכרון לאיכות הפלט. גרסאות 2 ביט מאבדות דיוק מורגש, וגרסאות מעל Q5_K_M דורשות זיכרון רב בלי שיפור אמיתי שניתן למדוד.

האם הוא מבין עברית טוב כמו מודל הבסיס?

הבדיקות שפורסמו לא בדקו שפות מעבר לאנגלית וסינית. מכיוון שהשינוי במשקולות היה ממוקד, יכולת השפה הכללית אמורה להישמר, אבל חובה לבדוק אותו בפועל מול הטקסטים שלכם.

איך מריצים

כדי להריץ אותו צריך גרסה עדכנית של llama.cpp שתומכת ב־MTP. קובץ בתצורת Q4_K_M שוקל 16.8 גיגהבייט ודורש כרטיס מסך עם לפחות 24 גיגהבייט זיכרון כדי להחזיק את המודל, שכבת הראייה וההקשר. אם אתם מוגבלים בזיכרון, גרסת IQ2_M יורדת ל־10.6 גיגהבייט, אבל משלמת במחיר של יציבות.

אפשר להריץ קובץ מאוחד שמכיל כבר את שכבת הטיוטה, או להפריד לקובץ בסיס וקובץ טיוטה ייעודי להאצה נוספת. אם אין לכם כרטיס ברמת RTX 3090 או 4090 ומעלה, עדיף להשתמש ב־API מרוחק במקום לנסות להריץ 27 מיליארד פרמטרים על מעבד מרכזי בקצב איטי.

ollama run hf.co/JonathanColetti/Qwen3.8-27B-Uncensored-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המקורי. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולהפיץ הלאה בחינם או בתשלום, בתנאי ששומרים על הודעות זכויות היוצרים ומצרפים עותק של הרישיון. תנאי השימוש ומדיניות השימוש ההוגן של מודל הבסיס עדיין חלים על התוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗