GPT
S

Silicon-Maid-7B-GGUF

קוד פתוח

TheBlokecc-by-4.02023-12-27

  • transformers
  • gguf
  • mistral
  • merge
  • not-for-all-audiences

גרסת GGUF למיזוג מבוסס מיסטרל שמכוון למשחקי תפקידים וכתיבה יוצרת. מתאים למי שמחפש ריצה מקומית קלה ועמידה בהוראות של כרטיסי דמות.

  • 51.2 GBמשקל הקבצים
  • 1,539הורדות בחודש
  • 66לייקים

מה זה

מדובר במיזוג של כמה מודלי 7B בשיטת DARE TIE, על בסיס Mistral-7B-v0.1, לצד מודלים כמו xDAN-L1, loyal-piano-m7 ו־Noromaid. המטרה של המפתח המקורי הייתה לחבר בין ביצועי שיחה גבוהים לבין כושר ביטוי יצירתי ללא חסימות. התוצאה קיבלה ציון של 7.96 במבחן MT-Bench, מה שמעמיד אותו קרוב מאוד לביצועי שיחה של מודלים סגורים מהתקופה ההיא, לפחות על הנייר.

בפועל, המיזוג הזה שונה ממודלי שיחה רגילים בכך שהוא עבר אופטימיזציה לטקסט סיפורי, אינטראקציות RPG ו־ERP, תוך הצמדות להגדרות דמות מורכבות. הוא עובד עם תבנית הפרומפט של Alpaca, והגרסאות כאן הן קבצי GGUF מוכנים שנועדו להקל על הטעינה בכלים ביתיים בלי להסתבך עם סביבות פייתון כבדות.

מתאים ל

  • משחקי תפקידים מקומיים

    שומר היטב על אופי הדמות לפי הוראות קבועות, ללא צנזורה ובלי שליחת נתונים החוצה.

  • כתיבה יוצרת ודיאלוגים

    מספק ניסוחים גמישים ועשירים יותר ממודלי שיחה סטנדרטיים בגודל שבעה מיליארד פרמטרים.

  • בוטים לאירוח או בידור

    מתאים לטעינה קלה על חומרת קצה פשוטה או שרתי ענן זולים בלי לדרוש משאבי ענק.

איפה זה נופל

היוצר מציין במפורש שהמיזוג פגע קשות ביכולות החשיבה הלוגית וכתיבת הקוד שהיו במודל המקורי. לא כדאי לבנות עליו למתמטיקה, ניתוח נתונים, פיתוח תוכנה או משימות שדורשות הבנה הנדסית מדויקת. הוא פשוט לא נבנה לזה. בנוסף, מדובר במודל שאומן על אנגלית בלבד ולכן הוא לא מתאים לעיבוד טקסטים בעברית, ואין לצפות ממנו להבנה לשונית מקומית.

שאלות
נפוצות

האם המודל תומך בעברית?

החומר הרשמי מגדיר אנגלית כשפה היחידה של המודל. הוא לא אומן על עברית ולא מיועד לפעול בה, כך שסביר להניח שיפיק טקסט משובש.

איזה קובץ הכי מומלץ להוריד מתוך המאגר?

הגרסה המאוזנת ביותר היא Q4_K_M, שנותנת יחס מעולה בין גודל קובץ לאיכות פלט. אם יש לכם מספיק זיכרון, קחו את Q5_K_M.

האם המודל מתאים לפיתוח בוט לתמיכה טכנית?

לא. המיזוג איבד חלק ניכר מיכולות ההיגיון והקוד שלו, והוא מכוון בעיקר לכתיבה יצירתית ומשחקי תפקידים ולא למענה מדויק.

איך מריצים

קובץ בודד של Q4_K_M שוקל 4.37 גיגה בייט ודורש כ־6.87 גיגה בייט זיכרון כדי לרוץ כולו על המעבד, כך שהוא מתאים לכל מחשב מודרני ממוצע. אם יש לכם כרטיס מסך עם לפחות 6 גיגה בייט VRAM, אפשר לטעון את כל השכבות ישירות אליו ולקבל מהירות תגובה גבוהה מאוד. מי שמחפש איכות טובה יותר יכול לקחת את Q5_K_M ששוקל 5.13 גיגה בייט, בעוד שגרסאות ה־Q2 וה־Q3 סובלות מירידה מורגשת ביכולות ולא מומלצות לטקסט.

ההרצה נעשית ישירות בתוכנות כמו LM Studio, Faraday.dev או llama.cpp דרך שורת הפקודה. שווה להריץ לבד אם אתם רוצים פרטיות מוחלטת לתוכן יצירתי, אבל אם אתם צריכים שירות יציב שרץ ברקע עבור משתמשים רבים באפליקציה, עדיף להשתמש ב־API מנוהל כדי לא לתחזק שרתים מקומיים.

ollama run hf.co/TheBloke/Silicon-Maid-7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון cc-by-4.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה מחדש של הקבצים, כולל שילוב במוצרים, בתנאי אחד פשוט: מתן קרדיט ברור ליוצרים המקוריים וציון הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗