GPT
Q

Qwen3-48B-A4B-Savant-Commander-Distill-12X-Closed-Open-Heretic-Uncensored-GGUF

קוד פתוח

DavidAUapache-2.02025-12-16

  • gguf
  • 256k context
  • Qwen3
  • Mixture of Experts
  • MOE

שעטנז של 12 מודלי זיקוק דחוסים בארכיטקטורת תערובת מומחים, שעברו הסרת סינון אגרסיבית. הוא מתאים למי שרוצה שליטה ידנית במומחה שמייצר את הטקסט בלי מגבלות תוכן.

  • 172 GBמשקל הקבצים
  • 1,950הורדות בחודש
  • 70לייקים

מה זה

הארכיטקטורה כאן מחברת 12 מודלים שונים של 4 מיליארד פרמטרים, שזוקקו ממודלים סגורים ופתוחים כמו קלוד, ג'מיני, ודיפסיק. כברירת מחדל רצים שני מומחים במקביל, אבל אפשר להפעיל עד 12 מומחים בו זמנית. הגימיק המרכזי הוא הניתוב הידני. במקום לתת למודל להחליט מי עונה, כותבים את שם המומחה בתחילת הפרומפט, למשל קלוד או ג'מיני, והמערכת מבודדת את השאר בעזרת שערים שליליים.

היוצר העביר כל מומחה תהליך הסרת סירובים נפרד עם כלי שנקרא הרטיק. שיעור הסירובים ירד מ־90 מתוך 100 ל־12 מתוך 100 בממוצע, עם מדד KLD של 0.05. בפועל זה אומר שהמודל כמעט ולא חוסם בקשות, החל מקללות ואימה ועד תוכן בוטה, כל עוד מכוונים אותו לשם.

מתאים ל

  • כתיבת סיפורי אימה ללא צנזורה

    שימוש במומחה מתאים מאפשר לייצר סצנות אימה קשות ותכנים בוטים שלא עוברים במודלים מסחריים רגילים.

  • משחקי תפקידים וצ'אט חופשי

    היכולת להגדיר שפה בוטה וסלנג בפרומפט מאפשרת שיחות עמוקות בלי לקבל סירובים אוטומטיים באמצע העלילה.

  • פתרון בעיות קוד ומתמטיקה

    ניתוב השאילתה ישירות למומחים המיועדים לחשיבה מאפשר להריץ משימות ניתוח מדויקות בלי לבזבז משאבים.

איפה זה נופל

למרות הסרת הסינון, המודל הזה עצלן בברירת המחדל שלו. אם לא תדחפו אותו במפורש להשתמש בסלנג, בקללות או בתיאורים גרפיים, התוצאה תצא יבשה ואנמית לגמרי. בנוסף, מנגנון הניתוב מחייב אתכם לציין את שמות המודלים ישירות בטקסט, ואם לא תגדירו את מקדמי ההחלקה והדגימה המומלצים, תקבלו חזרתיות מעצבנת שדורשת שניים או שלושה ניסיונות ייצור מחדש.

שאלות
נפוצות

איך גורמים למודל לפעול בלי לקבל תשובות יבשות?

המודל לא מסרב, אבל הוא זקוק להנחיה מפורשת כדי לא לכתוב בצורה מצונזרת. צריך להכניס לפרומפט מילים ספציפיות, סלנג או דרישה ישירה לשפה גרפית, אחרת ברירת המחדל שלו תישאר מתונה מאוד.

איך בוחרים איזה מודל יענה על השאלה?

כותבים את שם המומחה הרצוי בתחילת הפרומפט, כמו למשל קלוד, ג'מיני או GLM. אפשר גם להפעיל קבוצות שלמות באמצעות פקודות כמו AllAI כדי לשלב כמה מומחים יחד באותה תשובה.

האם אפשר להריץ אותו על חומרה ביתית רגילה?

כן, כל עוד נשארים בהגדרה של מומחה אחד או שניים במקביל ומשתמשים בכימות מתאים כמו Q4_K_S. ברגע שמפעילים יותר מומחים קצב ייצור הטוקנים יורד משמעותית ודרישות הזיכרון מזנקות.

איך מריצים

המודל מגיע בפורמט GGUF ותומך בהרצה על גבי מעבד עם פריקה חלקית לכרטיס מסך בתוכנות כמו KoboldCPP, LM Studio או שרת ייעודי של llama.cpp. בשביל להריץ אותו כמו שצריך בלי קריסות, המפתח דורש כימות מינימלי של Q4_K_S או IQ3_M ומזהיר שכימות נמוך מזה ישבור את הפלט. בגלל שמדובר בחיבור של מודלים שמגיע לנפח אחסון של 172 גיגה־בייט בקבצים השונים, נדרש כרטיס מסך עם זיכרון משמעותי כדי להריץ מעבר לשני מומחים פעילים.

אם אתם מתכננים להפעיל את כל 12 המומחים יחד בשביל לקבל את מלוא כוח החישוב, מהירות ייצור הטוקנים תצנח דרמטית. במקרים של עומס כזה, או אם אין לכם חומרה חזקה מקומית, עדיף לפנות ל־API של מודל גדול ומסחרי במקום לנסות לדחוף את כל המומחים לחומרה ביתית.

ollama run hf.co/DavidAU/Qwen3-48B-A4B-Savant-Commander-Distill-12X-Closed-Open-Heretic-Uncensored-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0 שמתיר שימוש מסחרי, שינוי קוד והפצה חופשית ללא תמלוגים, בתנאי ששומרים על הצהרת זכויות היוצרים המקורית ומצרפים עותק של הרישיון. עם זאת, קחו בחשבון שחלק מחומרי המקור הם זיקוקים של מודלים סגורים כמו GPT וקלוד, מה שעלול לייצר בעיות מול תנאי השימוש של החברות המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗