GPT
L

Llama-3.2-8X4B-MOE-V2-Dark-Champion-Instruct-uncensored-abliterated-21B-GGUF

קוד פתוח

DavidAUapache-2.02025-02-12

  • gguf
  • mixture of experts
  • moe
  • 8x4B
  • 8 experts

שילוב מומחים של שמונה מודלים קטנים לכדי 21 מיליארד פרמטרים ללא צנזורה. הוא נבנה לכתיבה עלילתית ומשחקי תפקידים שלא עוצרים באזהרות תוכן.

  • 124 GBמשקל הקבצים
  • 7,880הורדות בחודש
  • 145לייקים

מה זה

הבסיס כאן הוא מיזוג של שמונה מודלי Llama 3.2 בגודל 3B לכדי ארכיטקטורת MoE אחת של 21 מיליארד פרמטרים. המפתח שילב גרסאות שעברו הסרת צנזורה ושינויי יישור כמו JametMini, Enigma ו־Overthinker, יחד עם עיבוד שנקרא Brainstorm 5x לחיזוק הלוגיקה והיצירתיות. ברירת המחדל מפעילה שני מומחים בכל שלב, אבל אפשר להגדיר ידנית הרצה של עד שמונה מומחים במקביל. ככל שמפעילים יותר מומחים איכות הטקסט עולה, במחיר של מהירות הפלט.

התוצאה מכוונת ישירות לפרוזה, דיאלוגים וסצנות אופליין שלא מוגבלות על ידי מסנני בטיחות סטנדרטיים. הדף מדווח על רמת פרפלקסיטי נמוכה מזו של מודל Llama 3 הרשמי של מטא, מה שמעיד על חיזוי מילים יציב יחסית למיזוגים פיראטיים. הסגנון שלו נוטה למעט שליליות, מתח ותיאורים גרפיים, ולא מייצר סופים שמחים כברירת מחדל אלא אם מכוונים אותו לשם בהנחיה.

מתאים ל

  • משחקי תפקידים ללא הגבלה

    מנוע למערכות צ'אט פרטיות שדורשות היעדר חסימות תוכן, שפה בוטה ותיאורי אימה עשירים.

  • כתיבת סיפורת וסצנות אופליין

    יוצר טקסט מפורט עם דיאלוגים חיים ומתח, כשההנחיות מכוונות לעלילות אפלות וסגנון לא מצוחצח.

  • ניסויי ניתוב בארכיטקטורת MoE

    בדיקת ביצועים וקצבי יצירה של שימוש בשניים עד שמונה מומחים על גבי חומרה מקומית סטנדרטית.

איפה זה נופל

בגלל הבחירה האקראית של המומחים הפעילים בכל פנייה, התוצאות משתנות באופן קיצוני בין יצירה אחת לאחרת. היוצר מודה שנדרשות בין שתיים לארבע ריצות חוזרות של אותו הפרומפט כדי לקבל פלט איכותי באמת. בנוסף, נשארו בפנים מספר מודלים מצונזרים מהמיזוג המקורי, מה שגורם לו לפעמים לסרב לפקודות אלא אם מעלים את מספר המומחים או מריצים שוב. שפת המקור היא אנגלית בלבד, ואין לצפות ממנו לעברית קריאה. הוא גם לא מתאים למשימות קוד, חילוץ מידע מדויק או ניתוח נתונים עסקיים.

שאלות
נפוצות

איך אפשר לשלוט על רמת הצנזורה והסירובים שלו?

המיזוג כולל כמה רכיבים שעדיין מכילים מנגנוני סירוב. אם מקבלים תשובה מתחמקת, צריך להגדיר שימוש ביותר מומחים בכל טוקן, להעלות את הטמפרטורה מעל 1, או פשוט ללחוץ על כפתור היצירה מחדש פעמיים נוספות.

למה הטקסט יוצא שונה לגמרי בכל הרצה של אותו משפט?

המודל בוחר מומחים שונים מתוך השמונה לאורך שלבי היצירה. החלוקה הדינמית הזו גורמת לשונות גבוהה בסגנון ובתוכן, מה שמחייב שימוש בסאמפלרים מתקדמים כמו Dynamic Temp כדי לייצב את התוצאה.

איך מריצים

קובץ IQ4_XS שוקל מספיק מעט כדי לרוץ בקצב של מעל חמישים טוקנים לשנייה על כרטיס בודד של 16GB VRAM בהפעלת שני מומחים. כרטיסי מסך חזקים יותר יגיעו לקצב כפול. המאגר כולל 13 קבצים במשקל כולל של 124GB בפורמט GGUF, כולל גרסאות מותאמות למעבדי ARM.

אפשר להעלות אותו ישירות בתוכנות כמו KoboldCPP, LM Studio או שרת llama.cpp עם דגל הקצאת מומחים ייעודי. לא מדובר במוצר שמחפשים בשבילו ענן ציבורי. שירותי API מסחריים יחסמו מיד את סוג התוכן שהמודל הזה תוכנן לפלוט, כך שהרצה מקומית על ברזלים שלכם היא הדרך היחידה להפיק ממנו ערך.

ollama run hf.co/DavidAU/Llama-3.2-8X4B-MOE-V2-Dark-Champion-Instruct-uncensored-abliterated-21B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח במאגר הוא Apache 2.0, שמתיר שימוש מסחרי, שינוי קוד והפצה ללא תשלום תמלוגים. יחד עם זאת, המודל מבוסס על משקלי Llama של חברת מטא ומיזוג של שמונה מודלי קהילה שונים. שילוב כזה יוצר שטח אפור משפטי, כך שלא כדאי לבנות עליו כבסיס למוצר ארגוני שדורש עמידה בתנאי רישוי מחמירים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗