GPT
L

Llama-3-Lumimaid-8B-v0.1-OAS-GGUF-IQ-Imatrix

קוד פתוח

Lewdiculouscc-by-nc-4.02024-05-07

  • gguf
  • roleplay
  • llama3
  • sillytavern
  • endpoints_compatible

גרסה מכווצת של מודל המיועד למשחקי תפקידים ללא סירובים. הוא נבנה על בסיס למה 3 כדי לכתוב שיחות חופשיות בלי מעצורי בטיחות רגילים.

  • 119 GBמשקל הקבצים
  • 1,375הורדות בחודש
  • 76לייקים

מה זה

מדובר בכימות של מודל המבוסס על Llama 3 8B, שעבר אימון ייעודי למשחקי תפקידים ולתכנים למבוגרים לצד מידע כללי. היחס באימון עומד על 60 אחוז תוכן עלילתי ומיני לעומת 40 אחוז מידע רגיל, במטרה לשמור על יכולת שיחה סבירה בלי לפגוע בהבנה הבסיסית. המודל עבר תהליך שנקרא היגוי הפעלה אורתוגונלי, שגורם לו כמעט לא לסרב לבקשות של המשתמש, בניגוד למודלי בסיס מסחריים שנוטים לצנזר נושאים רגישים.

הקבצים במאגר הזה נוצרו באמצעות llama.cpp עם שקלול חשיבות כדי לצמצם פגיעה באיכות הטקסט בזמן הדחיסה. היוצר השתמש בגרסאות v2 שמתבססות על המרות ישירות של BF16 וכוללות תיקונים לבעיות שהיו בטיפול המוקדם בלמה 3.

מתאים ל

  • משחקי תפקידים למבוגרים

    הוא אומן על שילוב של תכנים עלילתיים ומיניים ועוצב לא לסרב לבקשות משתמש.

  • כתיבה יצירתית ללא סינון

    הסרת החסימות מאפשרת לפתח דיאלוגים מורכבים או בוטים בלי לקבל הודעות שגיאה.

  • הרצה מקומית על כרטיס יחיד

    כימות ה־Q4 עובד היטב על כרטיסי מסך ביתיים פופולריים בעלי 8 גיגה זיכרון.

איפה זה נופל

המודל הזה נבנה כמעט כולו עבור משחקי תפקידים ושיחות עלילתיות, ולכן הוא לא מתאים למשימות פיתוח, קידוד או שליפת עובדות מדויקות. ביטול מנגנוני הסירוב אומר שהוא עלול לייצר תוכן רעיל או פוגעני ללא התראה, שכן המאגרים שלו כוללים דאטהסטים של טקסטים בוטים. בנוסף, חובה להקפיד על שימוש בתוכנות הרצה עדכניות, אחרת פלט הטקסט עלול להשתבש בגלל בעיות תאימות ידועות בכימות של למה 3.

שאלות
נפוצות

איזה כרטיס מסך צריך כדי להריץ אותו בצורה שוטפת?

כרטיס עם 8 גיגה זיכרון מספיק עבור גרסת Q4_K_M בחלון הקשר של עד 12,288 טוקנים. אם תרצו להריץ כימות כבד יותר או חלון מלא, תצטרכו כרטיס חזק יותר עם 16 גיגה זיכרון ומעלה.

האם המודל מתאים לפיתוח בוט שירות או כתיבת קוד?

לא. הדאטה שלו מוטה בכבדות לעולמות משחקי התפקידים והוא אומן להגיב בחופשיות בלי מסנני בטיחות. למשימות תכנות או מענה עסקי עדיף לקחת מודל בסיס רגיל של למה 3.

איך מריצים

כדי להריץ אותו צריך כלי כמו KoboldCpp מגרסה 1.64 ומעלה, שתומך בתיקונים האחרונים של הפורמט, יחד עם הגדרות תואמות לתוכנות כמו SillyTavern. המודל משתמש בתבנית הפרומפט הרגילה של Llama 3.

כרטיס מסך עם 8 גיגה זיכרון יספיק להרצת כימות ברמת Q4_K_M עם חלון הקשר של עד 12,288 טוקנים. אם יש לכם חומרה חלשה יותר או שאין לכם כרטיס ייעודי, טעינת המשקלים המלאים תהיה איטית מאוד, אך בשל אופי התוכן הלא מצונזר אין כאן שירות ענן רשמי שמציע אותו דרך ממשק חיצוני פשוט.

ollama run hf.co/Lewdiculous/Llama-3-Lumimaid-8B-v0.1-OAS-GGUF-IQ-Imatrix:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא cc-by-nc-4.0. המשמעות פשוטה: השימוש מוגבל למטרות לא מסחריות בלבד, וחובה לתת קרדיט ליוצרים. אי אפשר לשלב אותו במוצר בתשלום, למכור גישה אליו או להשתמש בו לייצור רווחים ישירים.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗