GPT
W

Wizard-Vicuna-13B-Uncensored-GGUF

קוד פתוח

TheBlokeother2023-09-19

  • transformers
  • gguf
  • llama
  • uncensored
  • en

גרסת GGUF שעברה כימות של מודל שיחה בן 13 מיליארד פרמטרים. בוחרים בו כשצריכים מודל מקומי סביר שמגיב לכל בקשה בלי סירובים מובנים והטפות מוסר.

  • 91.9 GBמשקל הקבצים
  • 11,777הורדות בחודש
  • 101לייקים

מה זה

מדובר בהמרה של המודל שיצר אריק הרטפורד לפורמט GGUF להרצה מקומית. הבסיס הוא שילוב בין WizardLM לבין Vicuna, אך בשונה מגרסאות רגילות, הרטפורד סינן מסט הנתונים תשובות שכללו הטפות מוסר או מנגנוני יישור מובנים. המטרה היא לקבל משקלים נקיים שמאפשרים להוסיף שכבת התנהגות משלכם, למשל באמצעות LoRA מותאם אישית, במקום להילחם בסירובים של המודל המקורי.

המודל מיועד לשיחה ומענה על שאלות באנגלית באמצעות תבנית ה־Vicuna הרגילה. הוא מציע פשרה נוחה בין משאבים לביצועים עבור מודל 13B ישן יחסית, כשהיתרון המרכזי שלו נשאר הציות המלא להוראות המשתמש ללא חסימות או צנזורה.

מתאים ל

  • אימון שכבות יישור עצמאיות

    משמש כבסיס גולמי ונקי מהטפות מוסר שעליו מאמנים LoRA להתנהגות ייעודית.

  • סימולציות כתיבה ללא צנזורה

    מתאים לכתיבת דמויות וסיפורים בלי לקבל סירובים שרירותיים מהמערכת.

  • ניסויי מעבדה במחשב מקומי

    רץ מקומית דרך llama.cpp או LM Studio על חומרה ביתית סבירה.

איפה זה נופל

הכרטיס מדגיש שאין כאן מעקות בטיחות בכלל. המודל יענה על הכל, כולל דברים פוגעניים או מסוכנים, והאחריות על התוכן נופלת עליכם. בנוסף, חלון ההקשר עומד על 2048 טוקנים בלבד, מה שמגביל ניתוח של טקסטים ארוכים, והשפה הנתמכת רשמית היא אנגלית בלבד כך שביצועיו בעברית אינם מובטחים כלל.

אותה משפחה

Wizard-Vicuna-13B-Uncensored יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ להוריד מתוך הרשימה?

הקובץ המומלץ לרוב המשתמשים הוא Wizard-Vicuna-13B-Uncensored.Q4_K_M.gguf. הוא מאזן טוב בין גודל של כמעט שמונה ג'יגהבייט לבין איכות הפלט. אם החומרה שלכם חזקה יותר, גרסת Q5_K_M תספק תוצאות מדויקות יותר.

האם המודל תומך בעברית?

המודל אומן והוגדר רשמית עבור אנגלית בלבד. הוא עשוי לפלוט מילים בעברית, אבל איכות התחביר והתשובות תהיה נמוכה מאוד ולא הייתי בונה עליו לשימוש בעברית.

איך מריצים

ההרצה נעשית דרך llama.cpp, תוכנות כמו LM Studio או בספריות פייתון דוגמת ctransformers ו־llama-cpp-python. לא מורידים את כל המאגר ששוקל מעל תשעים ג'יגהבייט, אלא בוחרים קובץ בודד לפי החומרה שיש לכם. קובץ Q4_K_M שוקל 7.87 ג'יגהבייט ודורש מעט מעל עשרה ג'יגהבייט זיכרון להרצה על מעבד, או כרטיס מסך עם לפחות שמונה עד עשרה ג'יגהבייט זיכרון וידאו לטעינה מלאה או חלקית.

אם יש לכם כרטיס עם מספיק זיכרון, קבצי Q5_K_M או Q6_K נותנים איכות עדיפה עם פחות פגיעה בדיוק. במידה ואין לכם כרטיס מסך ייעודי או לפחות שישה עשר ג'יגהבייט זיכרון מערכת פנוי, הרצה מקומית תהיה אטית להחריד ובמקרה כזה עדיף לצרוך מודל מרוחק דרך API.

ollama run hf.co/TheBloke/Wizard-Vicuna-13B-Uncensored-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הרשום במאגר הוא other ולא צוין רישיון קוד פתוח מוכר. המשמעות היא שאין היתר שימוש מסחרי מוגדר, ומי שרוצה לשלב את המודל במוצר מסחרי לוקח סיכון משפטי ברור.

הרישיון המלא בעמוד המודל ↗