GPT
Q

Qwythos-9B-Claude-Mythos-5-1M-uncensored-heretic-GGUF

קוד פתוח

llmfan46apache-2.02026-06-29

  • transformers
  • gguf
  • qwen3.5
  • reasoning
  • uncensored

גרסת GGUF שעברה הסרת צנזורה אגרסיבית למודל חשיבה מבוסס Qwen3.5. הוא שומר על ביצועים גבוהים במתמטיקה וקוד בלי לחסום שאלות בנושאי אבטחה או רפואה.

  • 57.2 GBמשקל הקבצים
  • 10,750הורדות בחודש
  • 77לייקים

מה זה

מדובר בהמרה של המודל Qwythos-9B שפותח בידי Empero ועבר תהליך הסרת צנזורה בשיטת MPOA באמצעות כלי בשם Heretic. המטרה המרכזית בגרסה הזו היא לחתוך את שיעור הסירובים, ואכן במבחן של מאה שאלות הוא סירב רק ב־11 מקרים לעומת 73 במקור, תוך שמירה על מדד MMLU יציב של 77.35% מול 77.03% במודל הבסיס.

המודל אומן במקור על טרייסים של קלוד וכולל בלוקי חשיבה פנימיים לפני מתן התשובה. השילוב בין הסרת הצנזורה לבין היכולת להפעיל כלים כמו מריץ פייתון וחיפוש ברשת הופך אותו לפרקטי עבור משימות מחקר טכניות שלא עוברות את הסינון הרגיל של ספקיות הענן.

מתאים ל

  • מחקר אבטחת מידע

    ניתוח חולשות ומתודולוגיות תקיפה בלי שהמודל יסרב לענות עקב מדיניות בטיחות.

  • פתרון בעיות מתמטיות

    כתיבת קוד פייתון להרצה וחישוב תוצאות מדויקות עם שיעור הצלחה של 86% במבחן gsm8k.

  • סוכני אחזור עם כלים

    שילוב בפייפליין של קריאות לפונקציות וחיפוש חיצוני עם תיקון טעויות עצמי.

איפה זה נופל

חלון ההקשר המלא מגיע תאורטית למיליון טוקנים באמצעות YaRN, אך דורש כוח מחשוב כבד מאוד כדי לא לחנוק את הזיכרון, ובדיקות העומס המדווחות נעשו בפועל רק סביב 137 אלף טוקנים. בנוסף, YaRN סטטי ברמה כזו פוגע במעט באיכות הטקסט בהקשרים קצרים. אם תריצו אותו בטמפרטורה נמוכה מדי הוא יתנוון לחזרות מיותרות, ואימון הטקסט לא נגע בחלק הוויזואלי כך שיכולות התמונה נשענות על מודל המקור ללא כוונון ייעודי.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לעיבוד מסמכים ארוכים מאוד?

הוא כולל הגדרת הרחבה למיליון טוקנים, אבל תצטרכו שרת עם זיכרון גרפי מאסיבי כדי להחזיק נפח כזה. בפועל עדיף לבדוק אותו קודם בהקשרים קצרים ובינוניים, שכן ההרחבה פוגעת מעט בדיוק של פרומפטים קטנים.

למה המודל חוזר על עצמו בתשובות?

התופעה הזו קורית כשמריצים אותו בטמפרטורה נמוכה מדי. חובה להגדיר טמפרטורה סביב 0.6 ומקדם חזרתיות של 1.05 כדי למנוע ממנגנון החשיבה שלו להיתקע.

איך מריצים

הקבצים מחולקים למספר רמות כימות מקובלות, מ־Q4 ועד BF16 מלא, כאשר משקל כלל הקבצים במאגר עומד על 57.2 גיגה. גרסאות Q4 ו־Q8 שומרות על חלק ממשקלי ה־SSM ברמת דיוק גבוהה כדי לא לפגוע בארכיטקטורה. להרצה מקומית בכלי GGUF סטנדרטיים כמו llama.cpp תצטרכו כרטיס מסך בודד עם 8 עד 16 גיגה זיכרון גרפי עבור הקבצים המכווצים, אך אם תרצו תמיכה בתמונות תידרשו להוריד גם את קובץ ה־mmproj בנפרד.

הגדרות הדגימה קריטיות כאן, טמפרטורה נמוכה של 0.3 ומטה גורמת למודל להיתקע בלולאות חזרתיות, ולכן מומלץ לעבוד עם טמפרטורה של 0.6 ועונש חזרתיות של 1.05.

ollama run hf.co/llmfan46/Qwythos-9B-Claude-Mythos-5-1M-uncensored-heretic-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי קוד והפצה חופשית בתוך מוצרים, כל עוד אתם שומרים על הודעות זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗