GPT
L

Lumimaid-v0.2-8B-GGUF-IQ-Imatrix

קוד פתוח

Lewdiculouscc-by-nc-4.02024-07-28

  • transformers
  • gguf
  • roleplay
  • llama3
  • sillytavern

גרסת כימות של מודל המבוסס על Llama 3.1 8B, שעבר אימון ממוקד במשחקי תפקידים וכתיבה יוצרת. מתאים למי שמחפש הרצה מקומית בתוכנות כמו KoboldCpp או SillyTavern.

  • 74.3 GBמשקל הקבצים
  • 1,371הורדות בחודש
  • 43לייקים

מה זה

המודל הזה נבנה על גבי Meta Llama 3.1 8B Instruct על ידי צוות NeverSleep, והגרסה הנוכחית היא המרה לפורמט GGUF עם כימות מבוסס מטריצת חשיבות שביצע Lewdiculous. המטרה העיקרית שלו היא כתיבה יוצרת ומשחקי תפקידים. המפתחים מעידים שבגרסה 0.2 הם ניקו באגרסיביות טקסטים גנריים ושיחות ירודות ממאגר המידע, שכלל שילוב של דאטהסטים מבוססי Claude כמו Luminous Opus וסדרות אימון נוספות.

בניגוד למודלי בסיס כלליים, המודל הזה כוונן ספציפית לתגובות בתוך עלילה ודמויות, והוא משתמש בתבנית הפרומפט הרגילה של Llama 3 Instruct. הממיר ייצר את קובצי ה־imatrix ישירות מקובצי FP16 ו־BF16 כדי לצמצם אובדן דיוק במהלך הדחיסה. המפתחים ממליצים במפורש להוריד את ערכי הטמפרטורה כדי לקבל ממנו תוצאות עקביות.

מתאים ל

  • משחקי תפקידים ב־SillyTavern

    כוונן ספציפית לפרומפטים של דמויות ונתמך ישירות בהגדרות הקבועות מראש של הקהילה.

  • כתיבת סיפורים באנגלית

    אומן על סטים של כתיבה יוצרת במטרה להיפטר מניסוחים רובוטיים שחוזרים על עצמם.

  • הרצה מקומית על כרטיסי 8GB

    כימות ה־imatrix שומר על איכות טובה בנפח שמתאים לחומרה ביתית נפוצה.

איפה זה נופל

המודל מוגדר לשפה האנגלית בלבד, ואין לו התאמה או תמיכה בעברית. מאגרי האימון שלו מכילים סטים של שיחות רעילות במכוון כמו ToxicQAFinal ו־toxic dpo, כך שהוא עלול לייצר תכנים פוגעניים או בוטים מאוד. הוא לא מתאים לעבודה עסקית, חילוץ מידע, שאילתות קוד או פיתוח מענה לשירות לקוחות.

שאלות
נפוצות

איזה כרטיס מסך צריך כדי להריץ את הכימות המומלץ?

מספיק כרטיס מסך עם 8GB VRAM להרצת גרסת Q4_K_M-imat עם חלון הקשר של עד 12,288 טוקנים. אם רוצים למתוח את ההקשר מעבר לזה, תצטרכו להפעיל דחיסת מטמון בתוכנת ההרצה.

האם המודל מתאים ליישום מסחרי?

לא. הרישיון cc-by-nc-4.0 מגביל את השימוש לצרכים לא מסחריים בלבד, והוא אינו מיועד לפעילות עסקית.

איזו תבנית פרומפט צריך להגדיר עבורו?

המודל עובד עם תבנית ה־Instruct הרגילה של Llama 3, הכוללת את תגיות המערכת, המשתמש והעוזר המקוריות.

איך מריצים

כדי להריץ אותו צריך תוכנה שתומכת בפורמט כמו הגרסה העדכנית של KoboldCpp. לפי המפתח, גרסת הכימות Q4_K_M-imat דורשת כרטיס מסך עם לפחות 8GB זיכרון ומאפשרת הקשר של עד 12,288 טוקנים בלי דחיסת זיכרון. אם רוצים להגיע להקשר של עד 32,000 טוקנים על אותו כרטיס, צריך להפעיל דחיסת מטמון מפתחות וערכים, מה שמבטל את היכולת של המערכת לבצע הזזת הקשר.

אם אין לכם כרטיס ייעודי מקומי עם 8GB זיכרון פנוי, או שאתם לא צריכים אינטראקציה פרטית דרך ממשקים כמו SillyTavern, החזקת התשתית הזו לבד פשוט מיותרת.

ollama run hf.co/Lewdiculous/Lumimaid-v0.2-8B-GGUF-IQ-Imatrix:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא cc-by-nc-4.0. הרישיון הזה אוסר שימוש מסחרי מכל סוג, מחייב מתן קרדיט ליוצרים, ומתיר להריץ, לשנות ולשתף את הקבצים למטרות אישיות או מחקריות בלבד. אם אתם בונים מוצר בתשלום או שירות שמניב הכנסה, אסור להשתמש בו.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗