GPT
Q

Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF

קוד פתוח

HauhauCSapache-2.02026-08-17

  • gguf
  • uncensored
  • qwen3.8
  • multimodal
  • vision

גרסה נטולת סינונים של Qwen בגודל 27B שנועדה לענות ישר בלי הטפות מוסר. מגיעה בפורמט GGUF עם רכיב האצה מותאם שמקפיץ מהירות יצירת טקסט.

  • 161 GBמשקל הקבצים
  • 1,715,824הורדות בחודש
  • 1,066לייקים

מה זה

המודל הזה לוקח את הבסיס של Qwen3.8-27B ומסיר ממנו את מנגנוני הסירוב לחלוטין, עם תוצאה מדווחת של 0 סירובים מתוך 465 בדיקות. הוא כולל תמיכה במולטימודל לטקסט, תמונה ווידאו, ומציע ארכיטקטורה היברידית של 48 שכבות Gated DeltaNet לצד 16 שכבות gated-attention. מעבר להסרת המגבלות, ההבדל הבולט כאן הוא שילוב של FastMTP, מנגנון שמאיץ את ייצור הטוקנים על ידי חיזוי מקבילי בלי לשנות את התשובות עצמן.

לפי הבדיקות שפורסמו על כרטיס RTX PRO 6000 Blackwell, מנגנון ה־FastMTP מגיע עד פי 3.02 במהירות יצירת טקסט למסמכים ופי 1.93 במשימות חשיבה בהשוואה לריצה ללא MTP בכלל. מול MTP מובנה סטנדרטי הוא מציג תוספת ביצועים של עד 35.2 אחוז במסמכים. המשמעות המעשית היא ניצול טוב בהרבה של החומרה, במיוחד כשעובדים עם חלון הקשר ארוך.

מתאים ל

  • חילוץ מידע מפרומפטים קשים

    עונה ישר ולעניין בלי לבזבז טוקנים על הרצאות מוסר או סירובים מיותרים.

  • עיבוד מסמכים ארוכים

    רכיב ה־FastMTP מאיץ את יצירת הטקסט עד פי שלושה בהשוואה להרצה רגילה.

  • ניתוח משולב של טקסט ותמונה

    תומך בקלט תמונה ווידאו באמצעות מקרן ה־BF16 הייעודי שמצורף לפרויקט.

איפה זה נופל

הפרופיל האגרסיבי מיועד לתשובות ישירות בלי הקדמות, אבל היוצרים עצמם מזהירים שהוא פחות מתאים למשימות אמינות קריטיות של סוכנים אוטומטיים בהקשרים ארוכים. כשמבטלים מנגנוני זהירות לחלוטין, המודל עלול לפלוט מידע שגוי בביטחון מלא או לבצע פעולות לא רצויות בסביבת ייצור. בנוסף, חלון ההקשר המלא מגיע ל־262,144 טוקנים, אך הרצה שלו תדרוש משאבי זיכרון קיצוניים, כך שבפועל תיאלצו לצמצם אותו משמעותית על חומרה ביתית.

שאלות
נפוצות

האם חייבים לקמפל את הפאץ המיוחד בשביל להשתמש במודל?

לא. אפשר להריץ את קובצי ה־GGUF ישירות ב־llama.cpp רגיל או ב־LM Studio, אך כדי לקבל את תוספת המהירות של FastMTP תצטרכו את הפאץ ואת קובץ ה־sidecar. בלעדיהם תקבלו ביצועי MTP מובנים סטנדרטיים בלבד.

איך מבטלים את מצב החשיבה כדי לקבל תשובות מהירות יותר?

ברירת המחדל מפעילה מצב חשיבה. כדי לכבות אותו ולעבור למענה ישיר, מעבירים את הפרמטר enable_thinking כ־false בתבנית הצ'אט, ומעלים את ה־presence penalty ל־1.5 לפי ההמלצה הרשמית.

איך מריצים

משקלי המודל נעים בין 10.32 גיגה בייט בכימות IQ2_M ל־31.46 גיגה בייט ב־Q8_K_P. כדי להריץ כימות שמיש כמו Q4_K_P ששוקל כמעט 18 גיגה בייט, תצטרכו כרטיס מסך עם לפחות 24 גיגה זיכרון כדי להשאיר מקום ל־KV cache, במיוחד בהקשרים ארוכים. תמיכה בעיבוד תמונה דורשת קובץ מקרן BF16 נפרד ששוקל 931 מגה בייט.

מי שרוצה את מלוא הביצועים של FastMTP צריך לקמפל גרסה של llama.cpp עם פאץ ייעודי שמסופק במאגר ולהוסיף קובץ sidecar ששוקל 903 מגה בייט. אם אתם לא רוצים להסתבך עם קומפילציות של קוד C וניהול עומסי זיכרון מקומיים, מודלים מסחריים מנוהלים ב־API יחסכו לכם את כאב הראש הזה.

ollama run hf.co/HauhauCS/Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-MTP-GGUF:Q6_K_P

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי, שינוי קוד והפצה חופשית ללא תמלוגים. אם אתם משלבים אותו במוצר, אתם רק נדרשים לשמור על קרדיט מתאים, הצהרת הרישיון והודעות על שינויים שביצעתם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗