GPT
L

L3-8B-Stheno-v3.1-GGUF-IQ-Imatrix

קוד פתוח

Lewdiculouscc-by-nc-4.02024-05-20

  • transformers
  • gguf
  • roleplay
  • llama3
  • sillytavern

גרסת כימות של Llama 3 בת שמונה מיליארד פרמטרים שתוכננה למשחקי תפקידים. היא מיועדת למי שמחפש שיחות אחד על אחד באנגלית עם כתיבה יצירתית וללא צנזורה.

  • 52.1 GBמשקל הקבצים
  • 1,385הורדות בחודש
  • 95לייקים

מה זה

מדובר בכימות בשיטת Imatrix לקובצי GGUF, שנבנה על בסיס מודל שעבר כוונון עדין על דאטה משולב של Claude 3 Opus וטקסטים אנושיים. המטרה המרכזית שלו היא משחקי תפקידים, בניית דמויות וכתיבת סיפורים באנגלית, תוך שמירה על אופי הדמות לאורך הטקסט. בדירוג של Chaiverse תחת השם L3-RP-v2.1 הוא עבר ציון Elo של 1200.

הוא מתוכנן במיוחד לא להגביל או לצנזר תכנים במהלך תרחישי שיחה, ונוטה לייצר תכנים למבוגרים אלא אם מכוונים אותו אחרת בהנחיות. בשונה ממודלים בסיסיים בגודל הזה, הוא נשען על נתוני כרטיס דמות מפורטים כדי להפיק סגנון כתיבה עשיר ומשתנה בכל הפקה מחדש.

מתאים ל

  • משחקי תפקידים אחד על אחד

    המודל שומר על אופי הדמות בעקביות ומספק תשובות מגוונות בכל יצירה מחדש.

  • כתיבת סיפורים ופרוזה

    הוא מציג שפה עשירה באנגלית שמתאימה לפיתוח תרחישים ספרותיים מורכבים.

  • עוזר לתרחישי RPG

    מסוגל לתפקד כמספר בעולם דמיוני בתנאי שמזינים לו הקשר ודוגמאות מראש.

איפה זה נופל

המודל פולט לעיתים תגיות XML או קטעי טקסט לא קשורים, מה שמחייב יצירה מחדש של התשובה או הגדרת מחרוזות עצירה קפדניות. בנוסף, הוא נוטה מעצמו לכיוון של תכנים למבוגרים, ואם רוצים למנוע את זה חייבים לציין זאת מפורשות בהוראות המערכת. בתפקידים מורכבים כמו ניהול משחק או כתיבת עלילה רחבה הוא זקוק להקשר רחב ולדוגמאות מראש, אחרת איכות התוכן יורדת. חשוב גם לדעת שהיוצר ממליץ כיום לעבור לגרסה 3.2 שמתקנת תקלות מהגרסה הזו.

שאלות
נפוצות

איזה כרטיס מסך צריך כדי להריץ את המודל בצורה טובה?

כרטיס עם 8GB זיכרון ייעודי מספיק להרצת כימות Q4_K_M-imat עם הקשר של עד 12,288 טוקנים. מומלץ להשתמש ב־KoboldCpp כדי לטעון אותו ביעילות.

למה התשובות כוללות לפעמים תגיות טקסט משונות?

המודל סובל לעיתים מזליגת תגיות XML וג'יבריש כחלק מהפלט שלו. הגדרת מחרוזת עצירה של ירידת שורה ואחריה סימן קטן מ עוזרת לעצור את זה, או פשוט יוצרים את התשובה מחדש.

האם כדאי להוריד את הגרסה הזו או את 3.2?

עדיף להוריד ישירות את גרסה 3.2. היוצר מציין במפורש בעמוד שהיא כוללת תיקונים לתקלות נפוצות שנמצאו בגרסה 3.1 הזו.

איך מריצים

כדי להריץ אותו מקומית מומלץ להשתמש בתוכנת KoboldCpp בגרסה עדכנית, ולחבר אליה ממשק כמו SillyTavern. אם יש לכם כרטיס מסך עם 8GB זיכרון ייעודי, גרסת הכימות Q4_K_M-imat תרוץ עליו בצורה חלקה בהקשר של עד 12,288 טוקנים. השימוש דורש הגדרת פרמטרים ספציפיים כמו טמפרטורה גבוהה יחסית שבין 1.12 ל־1.32, ערך Min-P של 0.075 ומחרוזות עצירה ייעודיות לתגיות סיום.

אם אין לכם כרטיס מסך מתאים עם לפחות 8GB זיכרון, עדיף להריץ את העיבוד דרך שרת חיצוני או API. הרצה על מעבד רגיל בלבד בגודל הקשר כזה תהיה אטית מדי לשיחה רציפה.

ollama run hf.co/Lewdiculous/L3-8B-Stheno-v3.1-GGUF-IQ-Imatrix:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא CC-BY-NC 4.0. המשמעות פשוטה: השימוש מותר למטרות מחקר והרצה אישית בלבד. חל איסור מוחלט להשתמש בו, בנגזרות שלו או בתוצרים ישירים ממנו כחלק ממוצר מסחרי, שירות בתשלום או כל פעילות עסקית מניבת רווח.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗