GPT
L

L3-8B-Stheno-v3.2-GGUF-IQ-Imatrix

קוד פתוח

Lewdiculouscc-by-nc-4.02024-06-05

  • transformers
  • gguf
  • roleplay
  • llama3
  • sillytavern

גרסה מכווצת של מודל המבוסס על Llama 3 בגודל 8B, שעבר התאמה מיוחדת למשחקי תפקידים וכתיבה יוצרת. הוא פונה למי שמחפש מודל מקומי שלא מתחמק מתכנים מורכבים ועוקב טוב אחרי הוראות.

  • 56.7 GBמשקל הקבצים
  • 20,190הורדות בחודש
  • 281לייקים

מה זה

מדובר בכיול של Stheno v3.2, מודל שמיועד בעיקר לשיחות עמוקות, משחקי תפקידים דרך ממשקים כמו SillyTavern וכתיבת סיפורים. היוצר אימן אותו על שילוב של דאטה סט לכתיבה ודאטה סט של שיחות, תוך ניקוי ידני של דוגמאות גרועות מגרסאות קודמות, מה שהוריד את רמת ה־loss באימון. התוצאה היא מודל שיודע להפריד טוב יותר בין תוכן רגיל לתוכן למבוגרים בלי לדחוף גסויות בכוח לכל משפט.

ביחס לגודל של שמונה מיליארד פרמטרים, המודל מציג רציפות טובה בשיחות ארוכות מרובות תורות והיצמדות מדויקת יותר להנחיות המשתמש. היוצר מציין שהוא מעט פחות יצירתי מגרסה 3.1, אבל יציב הרבה יותר, ומתפקד בצורה סבירה גם במשימות עוזר רגילות בנוסף לכתיבה עלילתית. הקבצים כאן הוכנו עם imatrix מתוך קובצי המקור כדי לצמצם פגיעה באיכות הטקסט בזמן הכיווץ.

מתאים ל

  • משחקי תפקידים ב־SillyTavern

    הוא אומן להחזיק דמות לאורך זמן, לא נשבר מחוץ לתפקיד ועובד מעולה עם פרומפטים ייעודיים.

  • כתיבת סיפורים ועלילות

    כולל נתונים ממאגרי פרומפטים של כתיבה, עם שמירה טובה על רצף עלילתי ואיזון בין סגנונות.

  • הרצה מקומית על כרטיס 8GB

    גרסת ה־Q4 מותאמת בדיוק לזיכרון של כרטיסי מסך ביתיים פופולריים עם חלון הקשר נדיב.

איפה זה נופל

המודל אומן ותועד באנגלית בלבד, ולכן הוא לא מתאים לעבודה בעברית. בנוסף, היוצר מודה בגלוי שהגרסה הזו מעט פחות יצירתית מקודמתה לטובת יציבות והיצמדות לפקודות. הוא אמנם שופר במשימות עוזר כלליות, אבל הוא עדיין מודל 8B שמכוון למשחקי תפקידים וכתיבה, ולא תחליף למודלי קוד, מתמטיקה או אנליטיקה עסקית כבדה.

שאלות
נפוצות

האם המודל תומך בעברית?

הדאטה סט והבדיקות מוגדרים באנגלית בלבד. מודלי Llama 3 מסוגלים לפלוט עברית בסיסית, אבל הכוונון הספציפי הזה לא יועד לזה, ולכן הטקסט בעברית צפוי להיות מגושם ולא אמין.

איזה קובץ כדאי להוריד מתוך ה־16?

לרוב המשתמשים עם חומרת גיימינג בסיסית מומלץ לבחור ב־Q4_K_M-imat. הקובץ הזה נותן את האיזון הטוב ביותר בין שמירה על יכולות המודל לבין ניצול של עד 8GB בזיכרון כרטיס המסך.

איך מריצים

ההרצה פשוטה מאוד ומתאימה למחשב ביתי. היוצר ממליץ להשתמש בגרסה עדכנית של KoboldCpp. אם יש לכם כרטיס מסך עם 8GB זיכרון, הגרסה המומלצת היא Q4_K_M-imat שמגיעה עם 4.89 ביט למשקל, ומאפשרת להגיע להקשר של עד 12,288 טוקנים בלי לחרוג מהזיכרון.

המודל דורש תבנית פקודה של Llama-3-Instruct עם הגדרות דגימה ספציפיות שכוללות טמפרטורה גבוהה יחסית של 1.12 עד 1.22 ו־Min-P של 0.075. אם המחשב שלכם חלש יותר ואין כרטיס מסך ייעודי, עדיף להריץ אותו דרך שירות ענן או API מאשר לנסות לדחוף אותו למעבד בלבד.

ollama run hf.co/Lewdiculous/L3-8B-Stheno-v3.2-GGUF-IQ-Imatrix:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון של המודל הוא cc-by-nc-4.0. המשמעות ברורה וחד משמעית: השימוש מותר למטרות אישיות, מחקריות וניסיוניות בלבד. חל איסור מוחלט לשלב את המודל הזה במוצר מסחרי, לגבות עליו תשלום או להרוויח ממנו כסף באופן ישיר או עקיף בלי הסדר נפרד.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗