GPT
L

Llama-3.2-4X3B-MOE-Hell-California-Uncensored-10B-GGUF

קוד פתוח

DavidAUapache-2.02024-12-12

  • gguf
  • mixture of experts
  • moe
  • 4x3B
  • Llama 3.2 MOE

שילוב של ארבעה מודלים קטנים לכדי מודל מומחים של עשרה מיליארד פרמטרים. הוא מיועד למי שמחפש כתיבה יצירתית חופשית לגמרי, בלי מעצורים ובלי סינון תכנים.

  • 79.6 GBמשקל הקבצים
  • 5,134הורדות בחודש
  • 85לייקים

מה זה

הבסיס כאן הוא מיזוג של ארבע גרסאות שונות של Llama 3.2 בגודל 3B, כולן עברו הסרת מגבלות ותוכננו לפעול כמערך מומחים אחד. הרעיון הוא לקבל איכות כתיבה ועושר רעיוני של מודל גדול יותר, תוך שמירה על מהירות חישוב שמתאימה לחומרה נגישה.

הוא מתמקד בסיפורת, משחקי תפקידים, אימה ותוכן בוגר. הטקסטים שהוא מייצר נוטים להיות מפורטים וארוכים מהרגיל, עם נטייה מובנית לטון קודר. לפי נתוני המפתח, המודל מציג רמת פרפלקסיטי נמוכה מזו של מודל המקור של מטא, מה שמעיד על חיזוי טוקנים הדוק ויציב יותר במשימות יצירתיות, לצד תמיכה בחלון הקשר של עד 128k טוקנים.

מתאים ל

  • כתיבת סיפורי אימה ומתח

    הוא מתוכנן לתאר סצנות גרפיות ומורכבות בלי צנזורה ועם נטייה מובנית לטון אפל.

  • משחקי תפקידים מורכבים

    השילוב בין המומחים מאפשר דיאלוגים מגוונים ויכולת להגיב להוראות מפורטות.

  • יצירת עלילות ללא מגבלות

    מתאים לבניית תרחישים ספרותיים שמודלים מסחריים רגילים חוסמים בגלל תוכן בוגר.

איפה זה נופל

השליטה בתוצאות דורשת עבודה ידנית מתמדת. בגלל האופן שבו המומחים נבחרים באופן אקראי, אותה פקודה יכולה להניב רמות איכות שונות לחלוטין, ולעיתים קרובות תצטרכו לייצר מחדש את הפלט פעמיים עד ארבע פעמים כדי להגיע לתוצאה טובה. מעבר לכך, המודל אינו מצונזר בשום צורה ומכיל הטיות שליליות מובהקות, כך שהוא לחלוטין לא מתאים למוצרים הפונים לקהל רחב, לשירות לקוחות או לכל יישום עסקי שדורש עקביות וטון ניטרלי.

שאלות
נפוצות

האם המודל מתאים לעבודה בעברית?

הוא אומן על אנגלית בלבד. הוא עשוי לפלוט מילים בעברית בזכות משקלי הבסיס של Llama 3, אבל השפה תהיה עילגת, מקוטעת ולא שמישה למוצר.

איך משפיע שינוי מספר המומחים על הריצה?

ברירת המחדל משתמשת בשני מומחים. העלאה לשלושה או ארבעה מומחים משפרת את דיוק ההוראות ואיכות הטקסט, אך תאט משמעותית את קצב ייצור הטוקנים.

למה הטקסטים יוצאים שונים מאוד בכל ניסיון?

המנגנון משנה את צמד המומחים הפעיל בכל פעם. חוסר האחידות הזה מייצר מגוון רחב של רעיונות, אך מחייב לעיתים כמה יצירות מחדש של אותה הנחיה.

איך מריצים

קובץ בכימות IQ4_XS דורש כרטיס מסך עם 16GB זיכרון ומגיע לקצב של מעל 58 טוקנים לשנייה בהרצה של שני מומחים. כרטיסים גרפיים חזקים יותר יכפילו את הקצב הזה בקלות. אפשר להריץ אותו בכלים כמו LMStudio, KoboldCPP או llama.cpp באמצעות התבנית של Llama 3 או Command-R.

המאגר מכיל גרסאות כימות רגילות לצד גרסאות שמותאמות למעבדי ARM. כברירת מחדל מופעלים שני מומחים בכל שלב, אבל אפשר להגדיר שימוש בשלושה או ארבעה מומחים כדי לשפר את התוצאה, במחיר של ירידה במהירות הפלט.

ollama run hf.co/DavidAU/Llama-3.2-4X3B-MOE-Hell-California-Uncensored-10B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון apache-2.0 מאפשר שימוש חופשי לצרכים פרטיים ומסחריים, כולל שינוי והפצה של המשקלים. עם זאת, היות שמדובר במודל לא מצונזר שפולט תכנים קשים ובוגרים, שילוב שלו במוצר מסחרי מטיל את מלוא האחריות על התכנים שנוצרים ישירות עליכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗