GPT
Q

qwen3.8-27b-abliterated-3.69bpw-12GB-MTP.gguf

קוד פתוח

soyaakinoharaapache-2.02026-08-16

  • gguf
  • llama.cpp
  • qwen3.8
  • qwen3_5
  • gated-deltanet

גרסת GGUF מכווצת של Qwen בגודל 27B, שמסירה לחלוטין את מנגנוני הסירוב המובנים. היא נועדה להריץ מודל גדול יחסית על חומרת צרכנים בלי מעצורים של תקינות פוליטית.

  • 11.7 GBמשקל הקבצים
  • 47,545הורדות בחודש
  • 102לייקים

מה זה

המודל מבוסס על משקלי BF16 שעברו תהליך abliteration להסרת סירובים, וממיר אותם לפורמט GGUF בדחיסה מעורבת של 3.69 סיביות למשקל. במקום לדחוס את כל השכבות באותה צורה גסה, היוצר שמר על רכיבים רגישים בארכיטקטורת Gated DeltaNet ברמת דיוק גבוהה יותר כמו Q8 ו־Q4, בעוד ששכבות FFN מסוימות נדחסו חזק ל־IQ2 ו־IQ3.

הקובץ כולל גם תמיכה מובנית בראשי MTP לדגימה מהירה יותר, שנשמרו ברמת Q6. הכיול עצמו בוצע עצמאית באמצעות טקסטים באנגלית, יפנית וקוד מקור של llama.cpp, מה שהופך אותו לגרסה שמתמקדת ביעילות ריצה מקומית בלי לזרוק לפח את הדיוק של שכבות הליבה.

מתאים ל

  • כתיבה יצירתית ללא צנזורה

    יצירת תוכן חופשי, תסריטים ודיאלוגים מורכבים בלי לחטוף הודעות סירוב גנריות.

  • מחקר אבטחה ופגיעויות

    בדיקות חדירות וניתוח תרחישי תקיפה שמודלים מיושרים מסרבים לנתח.

  • הרצה מקומית על כרטיס יחיד

    קבלת יכולות של 27B בזיכרון של 16GB הודות לדחיסה המעורבת ותמיכת MTP.

איפה זה נופל

זהו מודל ללא מנגנוני בטיחות כלל, והוא יענה על בקשות מסוכנות או לא חוקיות בלי לסרב. חוץ מזה, דחיסה של 3.69 סיביות עם שכבות IQ2_S גובה מחיר בלוגיקה עדינה, והקובץ כולל רק את רכיב הטקסט ללא מודול ראייה. אם תרצו להזין תמונות, תצטרכו להביא קובץ mmproj תואם בנפרד.

שאלות
נפוצות

האם המודל תומך בעברית בצורה שוטפת?

הבסיס מגיע ממשפחת Qwen הרב־לשונית, אך כיול הדחיסה הספציפי נעשה על אנגלית, יפנית וקוד. הוא יידע לקרוא ולכתוב עברית ברמה הבסיסית של המודל המקורי, אך איכות הפלט בעברית עשויה להישחק מעט בגלל הדחיסה הנמוכה.

בשביל מה שמרו על מנגנון ה־MTP בתוך הקובץ?

ראשי ה־MTP מאפשרים ל־llama.cpp לבצע חיזוי טוקנים מקבילי ולדלג קדימה בזמן יצירת הטקסט. בהפעלה עם הדגל המתאים, המנגנון מקפיץ את קצב הפליטה בעשרות אחוזים בלי צורך במודל דראפט נפרד.

איך מריצים

ההרצה נעשית ישירות מול שרת llama.cpp עם תמיכה בהאצת MTP ודחיסת זיכרון הקשר. הקובץ תופס כ־11.7 גיגה־בייט, כך שהוא נכנס בכרטיס מסך בודד של 16 גיגה־בייט, או בחלוקה על פני שני כרטיסים צנועים יותר כמו שבדק היוצר על שילוב של 16 ו־8 גיגה־בייט.

בבדיקה על חומרה כזו עם פיצול שכבות ודגימת MTP נרשמה מהירות שיא של כ־37 טוקנים לשנייה. אם יש לכם רק כרטיס ישן עם 8 גיגה זיכרון או מעבד בלבד, עדיף להשתמש ב־API מרוחק כי קצב הפליטה המקומי יצנח.

ollama run hf.co/soyaakinohara/qwen3.8-27b-abliterated-3.69bpw-12GB-MTP.gguf:qwen3.8-27b-abliterated-3.69bpw-12GB-MTP

הקבצים

4 קבצים במאגר, 11.7 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות, להפיץ ולהטמיע במוצרים סגורים. התנאי היחיד הוא שמירה על הודעות זכויות היוצרים והרישיון המקורי, בלי אחריות מצד המפתחים על מה שהמשתמשים מייצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗