GPT
Q

Qwen3-24B-A4B-Freedom-Thinking-Abliterated-Heretic-NEO-Imatrix-GGUF

קוד פתוח

DavidAUapache-2.02025-12-09

  • gguf
  • 256k context
  • Qwen3
  • Mixture of Experts
  • MOE

מודל מבוסס תערובת מומחים של שישה מודלים בגודל ארבעה מיליארד פרמטרים, שעבר הסרת סינונים מוחלטת. הוא פונה למי שמחפש שליטה מדויקת בטקסטים אלימים, מיניים או חופשיים ללא סירובים מובנים.

  • 84.9 GBמשקל הקבצים
  • 1,853הורדות בחודש
  • 40לייקים

מה זה

מדובר בהרכבה של שישה מודלים שונים בגודל ארבעה מיליארד פרמטרים כל אחד, שמוזגו באמצעות Mergekit ומבוססים על זיקוקים של מודלים גדולים כמו קלוד וג'מיני. ברירת המחדל מפעילה מומחה אחד בלבד בכל רגע, אך המערכת נותנת אפשרות להפעיל בין מומחה בודד לכל ששת המומחים במקביל בהתאם למשאבים הזמינים. חלון ההקשר עומד על 256 אלף טוקנים, ותהליך ההסרה הוריד את שיעור הסירובים מ־90 מתוך 100 ל־15 מתוך 100 בלבד.

בדיקות ה־KLD מציגות ערך ממוצע של 0.05, נתון המצביע על סטייה נמוכה מאוד מהתנהגות מודל הבסיס המקורי למרות הפריצה והסרת החסימות. בלוק החשיבה שלו דחוס וקצר יחסית למודלים דומים, מה שמזרז את זמן ההגעה למענה עצמו. המודל מתמקד ביצירת טקסט ישיר, ומכוון לביצוע מדויק של פקודות קיצוניות בתחומי ספרות אימה, תוכן למבוגרים או מתמטיקה גבוהה בלי לחנך את המשתמש.

מתאים ל

  • כתיבת ספרות אימה בוטה

    המודל אינו עוצר תיאורים גרפיים או סצנות אלימות קשות אם מנחים אותו להשתמש בשפה ישירה.

  • יצירת תוכן למבוגרים

    מאפשר הפקת טקסטים מיניים ללא צנזורה מובנית, בתנאי שמגדירים מראש שימוש בסלנג מפורש.

  • הרצה מקומית על חומרה חלשה

    הפעלת מומחה יחיד מאפשרת קבלת קצב כתיבה מהיר על מעבדים ביתיים ללא צורך בכרטיס מסך יקר.

איפה זה נופל

למרות הסרת החסימות, כרטיס המודל מודה בפירוש שברירת המחדל שלו נשארת מתונה ויבשה. אם תבקשו קללות, אימה גרפית או תוכן למבוגרים בלי להגדיר מראש באילו מילים בוטות להשתמש, התוצאה תהיה אנמית ושטוחה. המודל דורש דחיפה יזומה והוראות ספציפיות מאוד כדי לייצר את הסגנון המבוקש. בנוסף, קיימת שגיאת חיתוך טקסט מתועדת בפלט הרשמי שלו, והוא עדיין מסרב לכ־15 מתוך 100 בקשות, כך שהוא אינו פתוח לחלוטין.

שאלות
נפוצות

האם המודל יכתוב תוכן בוטה מיד כשאבקש?

לא תמיד. כרטיס המודל מסביר שההגדרות הבסיסיות שלו נשארות רגועות יחסית, ולכן יש לפרט בהנחיה באילו מילים וסגנון מדויק אתם מעוניינים. ללא הנחיה מפורשת שמפרטת ביטויים או רמת בוטות, התוצאה שתתקבל תהיה מתונה.

כמה מומחים כדאי להפעיל בהרצה מקומית?

עבור מחשב עם מעבד רגיל או כרטיס מסך בסיסי, הפעלת מומחה אחד מספקת מהירות עבודה טובה של עשרות טוקנים לשנייה. כדאי להעלות לשניים עד שישה מומחים רק אם המחשב מצויד בזיכרון רחב ואתם זקוקים לכושר ניתוח מורכב יותר במשימות חשיבה.

איך מריצים

את קובצי ה־GGUF אפשר להריץ מקומית בתוכנות כמו LM Studio, KoboldCPP בגרסה 1.8 ומעלה, או דרך llama-server עם דגל הפעלת המומחים. הרצה של מומחה בודד מפיקה מעל 80 טוקנים לשנייה על מעבד גרפי פשוט, ובין 10 ל־20 טוקנים לשנייה על מעבד מרכזי בלבד. אם בוחרים להפעיל את כל ששת המומחים יחד, דרישות הזיכרון מזנקות לרמה של מודל עשרים וארבעה מיליארד פרמטרים מלא.

כדי למנוע תקלות ביצירת טקסט יוצר המודל ממליץ להגדיר smoothing factor על 1.5 או להעלות את עונש החזרתיות לטווח שבין 1.1 ל־1.15. אם יש לכם כרטיס מסך ביתי עם שמונה עד שנים עשר גיגה זיכרון, עדיף להריץ מקומית מומחה בודד או שניים בגרסת קוואנט כמו Q4, במקום לשלם לשרת ענן.

ollama run hf.co/DavidAU/Qwen3-24B-A4B-Freedom-Thinking-Abliterated-Heretic-NEO-Imatrix-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 המאפשר שימוש מסחרי, שינוי קוד, הרצה חופשית והפצה ללא תשלום תמלוגים. התנאי המרכזי דורש רק שמירה על הצהרת זכויות היוצרים המקורית וציון השינויים שבוצעו אם מעבירים את הקבצים הלאה. אתם רשאים לשלב אותו במוצר מסחרי בלי לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗