GPT
L

L3.2-Rogue-Creative-Instruct-Uncensored-Abliterated-7B-GGUF

קוד פתוח

DavidAUapache-2.02024-10-28

  • gguf
  • creative
  • Uncensored
  • Abliterated
  • creative writing

גרסה מורחבת של Llama 3.2 שעברה הסרת צנזורה ומתיחה ל־7.54 מיליארד פרמטרים. היא פונה למי שמחפש כתיבה יצירתית חופשית לגמרי בלי חסימות תוכן של מודלים מסחריים.

  • 56.9 GBמשקל הקבצים
  • 5,726הורדות בחודש
  • 163לייקים

מה זה

הבסיס הוא Llama 3.2 3B Instruct, אבל היוצר הוסיף לו 39 שכבות והפך אותו למודל של 67 שכבות ו־7.54 מיליארד פרמטרים בשיטה שהוא מכנה Brainstorm 40x. המטרה המרכזית בשינוי הזה היא כתיבת פרוזה מפורטת, יצירת עולמות ומשחקי תפקידים, לצד תהליך abliteration שמנטרל את מנגנוני הסירוב המובנים של מטא. הוא תומך בחלון הקשר מלא של 128k טוקנים, ועובד עם טמפרטורות גבוהות וחריגות שמגיעות עד 5 בלי לקרוס לג'יבריש מוחלט.

בניגוד למודלי 7B רגילים שאומנו מאפס על הגודל הזה, כאן מדובר בהרחבה מלאכותית של מודל קטן יותר. הטקסט שהוא מייצר נוטה להיות ארוך, תיאורי ועמוס בפרטי סביבה ודמויות, אבל המשמעות היא גם רגישות קיצונית להגדרות דגימה כמו repetition penalty וטמפרטורה, שקובעות אם הטקסט יהיה עשיר או יימרח למונולוגים אינסופיים.

מתאים ל

  • כתיבת סיפורת ואימה

    טוב ליצירת תיאורים גרפיים, סצנות מפורטות וז'אנרים אפלים בלי לחטוף הודעות סירוב על תוכן אלים.

  • משחקי תפקידים ב־SillyTavern

    מתאים לדמויות עם אופי מורכב ופרוזה חופשית, כל עוד מקפידים על הגדרת repetition penalty של 1.1 ומעלה.

  • סיעור מוחות יצירתי

    היכולת לייצר פסקאות ארוכות ועמוסות בדימויים מסייעת לבניית עולמות ופיתוח דיאלוגים מורכבים.

איפה זה נופל

המודל הזה אינו כלי אמין למידע, קוד או משימות דיוק. הכרטיס מודה במפורש בבעיות שגיאות כתיב מזדמנות, היעדר אותיות גדולות באנגלית, ונטייה להיכנס ל־rant, כלומר מריחה של טקסט באורח חריג כשמשתמשים בפרומפטים קצרים או ביחסי דגימה שגויים. בנוסף, הוא מאומן באנגלית בלבד, כך שעברית כנראה תהיה שבורה, וקוואנטים נמוכים מ־Q4 פוגעים בו קשות.

שאלות
נפוצות

למה המודל חוזר על פסקאות בסוף התשובה?

זה קורה אם repetition penalty מוגדר מתחת ל־1.05. כדי לפתור את זה, תעלו את הערך ל־1.05 או 1.1, או שתפעילו smoothing factor בכלי ההרצה שלכם.

האם הוא מבין ועונה בעברית בצורה שוטפת?

לא. המודל הוגדר ואומן באנגלית בלבד, וההרחבה שלו התמקדה בפרוזה באנגלית. ניסיון להריץ אותו בעברית יפיק תוצאות נחותות ולא עקביות.

איזה קוואנט הכי כדאי להוריד מהרשימה?

אם יש לכם כרטיס עם 8 גיגה זיכרון ומעלה, לכו על Q5_K_M או Q4_K_M. מתחת ל־Q4, במיוחד ב־Q2 ו־Q3, המודל מתפרק ומייצר שיבושים קשים.

איך מריצים

הקבצים שוקלים יחד 56.9 גיגה בייטים בפורמט GGUF, אבל מורידים קובץ קוואנט אחד שמתאים לחומרה שלכם. גרסאות Q4KM או Q5 דורשות סביב 6 עד 8 גיגה זיכרון וידאו, מה שאומר שכרטיס RTX 3060 ומעלה מריץ אותם בלי לגעת במעבד. יש במאגר גם קוואנטים ייעודיים ל־ARM שלא יעבדו טוב על מעבדי x86, וקוואנטים נמוכים כמו Q2k ו־Q3 שסובלים מאיבוד איכות כבד ומחייבים להוריד טמפרטורה מתחת ל־1 או 2.

מריצים אותו בכלים מקומיים כמו KoboldCpp, oobabooga או SillyTavern עם תבנית Llama 3 או Command-R. חובה להגדיר repetition penalty של לפחות 1.05 כדי שלא יחזור על פסקאות, ועדיף להפעיל smoothing factor סביב 1.5 עד 2.5 כדי לייצב אותו.

ollama run hf.co/DavidAU/L3.2-Rogue-Creative-Instruct-Uncensored-Abliterated-7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא Apache 2.0. הוא מתיר שימוש מסחרי, שינוי והפצה של הקוד והמשקלים ללא תשלום תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון. שימו לב שהבסיס נשען על Llama 3.2, שכפופה לתנאי הקהילה של מטא, כך שיש לוודא שאין סתירה ביניהם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗