GPT
N

Nyanade_Stunna-Maid-7B-v0.2-GGUF-IQ-Imatrix

קוד פתוח

Lewdiculousother2024-04-15

  • gguf
  • quantized
  • roleplay
  • multimodal
  • vision

גרסת GGUF שעברה כיול לטובת משחקי תפקידים חופשיים ללא מעצורים. מתאים למי שמחפש מודל 7B עם תמיכה בעיבוד תמונה וחלון הקשר של 32k.

  • 57.3 GBמשקל הקבצים
  • 2,016הורדות בחודש
  • 59לייקים

מה זה

מדובר בכיול של המודל Nyanade_Stunna-Maid-7B-v0.2 בפורמט GGUF תוך שימוש ב־Imatrix. תהליך הכיול הזה נועד לשמר כמה שיותר מידע ודיוק במודל המכווץ, במיוחד בטקסטים של דיאלוגים ומשחקי תפקידים, הודות לקובץ נתוני כיול ייעודי. הדגש פה הוא על סגנון כתיבה פתוח, ללא יישור קו בטיחותי מחמיר, שמכוון לשיחות ארוכות ומפורטות.

בנוסף ליכולות הטקסט, הוא מציע תמיכה במולטימודאליות דרך רכיב ראייה חיצוני תואם. זה לא מודל סטנדרטי לעבודה משרדית או סיכום מסמכים, אלא כלי שמיועד ספציפית לתרחישי אינטראקציה ודמויות שדורשים גמישות סגנונית וזיכרון עבודה רחב.

מתאים ל

  • משחקי תפקידים ב־SillyTavern

    המודל כויל עם נתוני דיאלוגים ומיועד בדיוק לממשקים האלה עם הגדרות יצירתיות גבוהות.

  • אינטראקציה עם תמונות מקומית

    מאפשר תיאור תמונות בתוך שיחה בזכות שילוב קובץ הראייה של llava על כרטיס ביתי.

  • שיחות ארוכות ללא צנזורה

    תומך בחלון הקשר של עד 32k ולא כולל מגבלות תוכן שחוסמות תרחישים שונים.

איפה זה נופל

המודל מוגדר כחסר יישור קו ובלי מגבלות תוכן, כך שהוא עלול לייצר טקסט בוטה או לא הולם. היוצר מציין במפורש נטייה לחזרתיות וחוסר גיוון בתשובות, וממליץ להעלות את הטמפרטורה ל־1.15, לקבוע MinP על 0.075 ולהפעיל ענישה על חזרתיות בערך 1.15 לטווח של 1024 טוקנים כדי לאזן את זה.

שאלות
נפוצות

איך מפעילים את יכולות הראייה במודל?

המודל עצמו מכיל את משקלי השפה בלבד. כדי לנתח תמונות צריך להוריד בנפרד קובץ mmproj תואם ולטעון אותו ב־KoboldCpp דרך הממשק או עם הדגל mmproj בשורת הפקודה.

מה עושים כשהתשובות חוזרות על עצמן שוב ושוב?

מעלים את הטמפרטורה ל־1.15 ומכוונים את MinP ל־0.075. בנוסף מומלץ להגדיר ענישה על חזרתיות בערך 1.15 על פני טווח של 1024 טוקנים.

איך מריצים

טעינת המודל מתבצעת בעיקר דרך KoboldCpp או llama.cpp, כשאפשר לחבר אותו לממשקים כמו SillyTavern. אם רוצים להשתמש בעיבוד תמונה, חובה לטעון במקביל קובץ mmproj מתאים דרך הדגל הייעודי בפקודת ההרצה או בממשק.

כרטיס גרפי עם 11 עד 12 גיגה זיכרון מריץ בנוחות את גרסת Q6_K-imat בקצב טוב. למחשבים עם 8 גיגה זיכרון מומלץ לקחת את Q5_K_M-imat לטקסט בלבד, או לרדת ל־Q4_K_M-imat אם מפעילים ראייה, כדי שהזיכרון לא יוצף. עם 6 גיגה זיכרון תצטרכו להסתפק בגרסאות IQ3.

ollama run hf.co/Lewdiculous/Nyanade_Stunna-Maid-7B-v0.2-GGUF-IQ-Imatrix:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר כ־other ללא פירוט של תנאים מסחריים או הגבלות שימוש ברורות. במצב כזה אין אישור מפורש לשימוש מסחרי, ואי אפשר להסתמך עליו בבניית מוצר פתוח ללקוחות בלי לבדוק את תנאי דגמי המקור שמהם הוא נוצר.

הרישיון המלא בעמוד המודל ↗