GPT
L

Llama-3.2-8X3B-MOE-Dark-Champion-Instruct-uncensored-abliterated-18.4B-GGUF

קוד פתוח

DavidAUapache-2.02024-12-10

  • gguf
  • mixture of experts
  • moe
  • 8x3B
  • Llama 3.2 MOE

שילוב של שמונה מודלים קטנים לכדי מודל מומחים נטול צנזורה. נוצר לכתיבה יצירתית, פרוזה מפורטת ומשחקי תפקידים שדורשים חופש מלא בלי חסימות.

  • 139 GBמשקל הקבצים
  • 39,738הורדות בחודש
  • 625לייקים

מה זה

הפרויקט הזה לוקח שמונה גרסאות שונות של Llama 3.2 3B ומחבר אותן באמצעות Mergekit לארכיטקטורת מומחים בנפח כולל של 18.4 מיליארד פרמטרים. הרעיון הוא לתת עומק של מודל גדול בהרבה בלי לשלם את מלוא מחיר החישוב, כאשר כברירת מחדל רצים רק שני מומחים בכל שלב. ההרכב כולל מודלים שעברו הסרת צנזורה לצד גרסאות מכווננות כתיבה.

בניגוד למודלי בסיס שמנסים לענות על הכל בצורה מאוזנת ויבשה, הדגש כאן הוא פרוזה חיה, תיאורים מוחשיים ודיאלוגים מורכבים. הוא מציג נטייה מובנית לטון מעט אפל או מחוספס, מנקה ניסוחים רובוטיים של ChatGPT, ויודע להתמודד עם ז'אנרים של אימה, רומנטיקה ותוכן למבוגרים. המשתמש יכול לקבוע בהגדרות כמה מומחים ישתתפו בבחירת המילים, מה שמשנה ישירות את איכות הטקסט ואת עושרו.

לפי נתוני הכרטיס, בריצה של שני מומחים הוא מגיע ליותר מ־50 טוקנים לשנייה בקוונט IQ4_XS על כרטיס עם 16 גיגהבייט זיכרון. המשמעות היא תגובה שמרגישה כמעט מיידית בצ'אט, אבל ככל שמעלים את מספר המומחים הפעילים לעבודה מורכבת יותר, המהירות הזו יורדת בהתאם.

מתאים ל

  • כתיבת סיפורת וסצנות

    מייצר פרוזה עשירה ודיאלוגים מדויקים ללא צנזורה על נושאים אפלים או יחסים מורכבים.

  • משחקי תפקידים בטקסט

    מגיב מצוין כדמות מורכבת בצ'אט ומחזיק נרטיב מחוספס לפי דרישות המשתמש.

  • פיתוח עלילה ותוכן אימה

    בעל נטייה טבעית לתיאורים מוחשיים ומתח בלי לחסום תיאורי זוועה או אלימות.

איפה זה נופל

בגלל שחלק משמונת המודלים המקוריים כן עברו צנזורה במקור, המערכת לא נקייה לחלוטין מסירובים. היוצר מציין במפורש שבמקרים מסוימים תצטרכו לייצר מחדש את התשובה פעמיים או שלוש, או להעלות את מספר המומחים הפעילים כדי לעקוף חסימה מקרית.

בנוסף, המודל רגיש מאוד לדגימה ונוטה לייצר תוצאות שונות לחלוטין בכל הרצה מחדש של אותו הפרומפט. הוא דורש משחק עדין עם הגדרות טמפרטורה וסאמפלרים כמו Smooth או רגרסיה של חזרתיות, ולא יתאים למי שמחפש מודל יציב למשימות קוד, חילוץ נתונים או תשובות עובדתיות חד משמעיות.

שאלות
נפוצות

האם הוא מדבר וכותב בעברית?

המודל מאומן ומוגדר רשמית לשפה האנגלית בלבד. מודלי Llama 3.2 מכירים עברית בסיסית, אך בשילוב המומחים הזה כתיבה יצירתית מורכבת בעברית תהיה עילגת ולא אמינה.

למה התשובה נחסמת לי אם המודל מוגדר ללא צנזורה?

חלק משמונת המודלים שמרכיבים אותו עדיין מכילים מגבלות בטיחות מהאימון המקורי. בחירה אקראית של מומחה כזה עשויה להוביל לסירוב, והפתרון שהיוצר מציע הוא להפיק שוב את הטקסט או להגדיל את כמות המומחים הפעילים בו זמנית.

באיזה תבנית פרומפט חובה להשתמש?

הוא נבנה סביב התבנית הרשמית של Llama 3 עם תגיות המערכת והמשתמש הרגילות. היוצר מציין שתבנית של Command-R עובדת גם כן, אך היא תשנה מהותית את אופי הניסוח והפלט.

איך מריצים

כדי להריץ אותו צריך תוכנה שתומכת בפורמט GGUF ובחלוקת מומחים, כמו KoboldCPP, LM Studio או llama.cpp. עבור גרסת הקוונט הנפוצה IQ4_XS תצטרכו לפחות כרטיס מסך עם 16 גיגהבייט זיכרון כדי לטעון את המשקלים ולקבל מהירות עבודה טובה עם שני מומחים פעילים. המאגר מכיל 16 קבצים במשקל כולל של 139 גיגהבייט, כולל גרסאות ARM ודחיסות שונות, כך שמורידים רק את הקובץ הספציפי שמתאים לגודל הזיכרון שלכם.

אם אתם מתכננים להריץ 4 עד 8 מומחים במקביל או לפתוח את חלון ההקשר המלא של 128k, תצטרכו חומרה חזקה בהרבה או שתספגו ירידה דרסטית בקצב הפקת המילים. לשימושים קצרים ובדיקות חד פעמיות של כתיבה, שווה לבדוק אם עדיף להשתמש ב־API מבוסס ענן במקום להחזיק כרטיס ייעודי כבד דולק במחשב.

ollama run hf.co/DavidAU/Llama-3.2-8X3B-MOE-Dark-Champion-Instruct-uncensored-abliterated-18.4B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מסומן ברישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה של הקוד והמשקלים ללא תשלום תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון. שימו לב שהמודלים שמהם הורכב השילוב נשענים על רישיון הבסיס של מטא עבור Llama 3.2, שמטיל תנאים משלו על שירותים מסחריים גדולים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗