GPT
L

L3-8B-Stheno-v3.3-32K-GGUF-IQ-Imatrix

קוד פתוח

Lewdiculouscc-by-nc-4.02024-06-23

  • transformers
  • gguf
  • roleplay
  • llama3
  • sillytavern

גרסת קוונטיזציה של מודל Llama 3 8B שמכוונת למשחקי תפקידים וכתיבה יוצרת. ההקשר הורחב מ־8K המקוריים ל־32K טוקנים.

  • 77.7 GBמשקל הקבצים
  • 1,384הורדות בחודש
  • 43לייקים

מה זה

המודל הזה הוא גרסה מכוונת של לאמה 3 בגודל שמונה מיליארד פרמטרים, שנבנתה במקור על ידי Sao10K ועברה כאן המרה לפורמט GGUF עם כיול חכם בשיטת אימטריקס. הדגש פה הוא על כתיבה יוצרת ומשחקי תפקידים עם נתונים שעברו סינון ידני כדי להעלות את רמת הטקסט. הנתונים בכרטיס מציינים הכפלה של דוגמאות כתיבה יצירתית ועיבוד מחדש של הוראות מורכבות.

במקום לעצור בחלון הבסיסי של שמונה אלף טוקנים, האימון השתמש בשיטת PoSE כדי למתוח את ההקשר ל־32 אלף טוקנים. מבחן המחט בערימת שחת שנערך למודל הראה תוצאות עקביות, אך היוצר מציין במפורש שההבנה וההיגיון בהקשרים הארוכים עדיין מוגבלים ביחס להרחבות טבעיות, אף על פי שהמצב טוב יותר מסילום חבלים רגיל.

מתאים ל

  • משחקי תפקידים מקומיים

    האימון עבר סינון ידני קפדני לטובת זרימת שיחה טבעית ומענה מפורט.

  • כתיבת סיפורים ארוכים

    מאגר הנתונים הוכפל בדוגמאות כתיבה יצירתית עם הקשר של 32K.

  • הרצה מקומית על 8GB VRAM

    קובץ Q4 מכויל מאפשר הקשר של מעל 12 אלף טוקנים על חומרה ביתית.

איפה זה נופל

זה אינו מודל 32K טבעי, והיוצר מודה בגלוי שיש ירידה ביכולות ההבנה וההסקה כשההקשר נמתח לקצה. בנוסף, המודל אומן על אנגלית בלבד, כך שאין מה לצפות לביצועים סבירים בעברית. יוצר המודל המקורי אף ציין שהוא בדק אותו רק בפורמט bf16 המלא ולא בדק כיצד הקוונטיזציה משפיעה על התוצרים בפועל.

שאלות
נפוצות

האם המודל יבין עברית?

לא כדאי לבנות על זה. המודל מסומן רשמית לשפה האנגלית בלבד, וכל כוונוני הנתונים של משחקי התפקידים והכתיבה נעשו באנגלית.

מה צריך כדי להריץ אותו בלי שהמחשב יקרוס?

כרטיס מסך עם שמונה גיגה זיכרון יספיק לגרסת Q4_K_M-imat עד חלון של 12,288 טוקנים. להרצה מומלץ להשתמש בגרסה העדכנית ביותר של KoboldCpp.

האם חלון ה־32K מתפקד כמו מודל שנבנה מראש לגודל כזה?

לא. ההרחבה בוצעה באימון מיוחד על גבי בסיס של 8K, ולמרות שמבחן שליפת המידע הצליח, היוצר מבהיר שההיגיון בהקשר ארוך עדיין מוגבל.

איך מריצים

כדי להריץ את הקבצים האלה צריך גרסה עדכנית של KoboldCpp. לפי המפתח, מי שמחזיק כרטיס מסך עם שמונה גיגה זיכרון יכול להריץ את קובץ ה־Q4_K_M-imat עם חלון הקשר של עד 12,288 טוקנים בלי לחנוק את החומרה.

המפרסם יצר את נתוני הכיול ישירות מקובצי FP16 ו־BF16 כדי לצמצם ירידה באיכות במהלך ההמרה. יש כאן מגוון קובצי כיול שמתאימים למגבלות חומרה שונות, ומערכי הגדרות מוכנים זמינים עבור תוכנות ממשק כמו SillyTavern.

ollama run hf.co/Lewdiculous/L3-8B-Stheno-v3.3-32K-GGUF-IQ-Imatrix:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון cc-by-nc-4.0. המשמעות פשוטה: מותר להוריד, לשנות ולהריץ אותו באופן פרטי, אבל אסור לעשות בו שום שימוש מסחרי, מה שמונע מכם להטמיע אותו במוצר שנמכר ללקוחות.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא בעמוד המודל ↗