GPT
W

Wizard-Vicuna-30B-Uncensored-GGUF

קוד פתוח

TheBlokeother2023-09-19

  • transformers
  • gguf
  • llama
  • uncensored
  • en

גרסה מכווצת של מודל שיחה בגודל 30 מיליארד פרמטרים שנוקה מסינונים והטפות מוסר. מיועד למי שצריך מודל מקומי שלא מסרב לבקשות.

  • 229 GBמשקל הקבצים
  • 4,205הורדות בחודש
  • 60לייקים

מה זה

מדובר בהמרה לפורמט GGUF של המודל שאימן Eric Hartford, ומיועדת להרצה מקומית על מעבדים וכרטיסי מסך. הבסיס הוא שילוב של Wizard ו־Vicuna, אך בניגוד למודלים רגילים, הוצאו מדאטה־סט האימון כל התשובות שכללו הטפות מוסר או סירובים מובנים. המטרה של היוצר הייתה לתת בסיס גולמי ללא יישור התנהגותי, כך שמי שרוצה יוכל להוסיף שכבת התנהגות משלו.

המודל מגיע במספר רמות דחיסה מ־2 ביט ועד 8 ביט. אין בכרטיס תוצאות בנצ'מרק מספריות, אבל הדחיסות הנמוכות מאוד מאבדות איכות בצורה ניכרת. מודל 30B מספק יכולות ניסוח והבנה טובות משמעותית ממודלים קטנים של 7B או 13B מאותה תקופה, במיוחד במענה מורכב לפי תבנית השיחה של Vicuna.

מתאים ל

  • מחקר על מודלים ללא סינון

    בדיקת התנהגות מודל שפה כשמסירים ממנו את שכבות הבטיחות ויישור הנתונים.

  • אימון שכבות התאמה אישיות

    בסיס נקי מהטיות מובנות שמאפשר להלביש עליו שכבת LoRA לפי כללים שלכם.

  • עוזר מקומי על חומרה חזקה

    הרצת שיחות פרטיות לגמרי באנגלית ללא מעבר בשרתים חיצוניים או סינון תשובות.

איפה זה נופל

המודל מוגדר במפורש ככזה שאין לו מעצורים או מנגנוני בטיחות. הוא מסוגל לייצר תוכן מזיק, פוגעני או מסוכן בלי שום אזהרה, והיוצר מבהיר שהאחריות על הפלטים נופלת כולה על המשתמש. בנוסף, חלון ההקשר המקורי בדוגמה עומד על 2048 טוקנים בלבד, והשפה המוגדרת בו היא אנגלית, כך שאין לצפות לביצועים סבירים בעברית.

אותה משפחה

Wizard-Vicuna-30B-Uncensored יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ כדאי להוריד מתוך הרשימה?

עדיף להוריד רק את הקובץ Wizard-Vicuna-30B-Uncensored.Q4_K_M.gguf. הוא נותן את האיזון הטוב ביותר בין שמירה על יכולות המודל לנפח זיכרון של כ־22 גיגה־בייט. גרסאות Q2 ו־Q3 סובלות מאיבוד איכות מורגש ולא מומלצות.

האם המודל מתאים למוצר שפונה ללקוחות?

ממש לא. אין לו מנגנוני סינון ובטיחות, והוא עלול לפלוט תוכן פוגעני או שגוי ישירות למשתמש הקצה. מעבר לזה, הרישיון לא מוגדר בבירור ואינו מאשר שימוש מסחרי בצורה מפורשת.

איך מריצים

בשביל להריץ אותו צריך כלי שתומך ב־GGUF, כמו llama.cpp, text-generation-webui, או ספריות פייתון כמו ctransformers. גרסת האיזון המומלצת בדף היא Q4_K_M ששוקלת 19.62 גיגה־בייט ודורשת לפחות 22.12 גיגה־בייט זיכרון פנוי כדי לרוץ על המעבד בלבד. אם רוצים איכות גבוהה יותר, יש את Q5_K_M שדורשת מעל 25 גיגה־בייט זיכרון.

אם יש לכם כרטיס מסך עם זיכרון ייעודי גדול, אפשר להעביר שכבות אליו עם הדגל ngl כדי לקבל קצב יצירה שמיש. למי שאין לפחות 32 גיגה־בייט זיכרון עבודה במחשב או כרטיס מסך חזק, אין טעם לנסות להריץ אותו מקומית ועדיף לפנות למודל מרוחק דרך ממשק תכנותי.

ollama run hf.co/TheBloke/Wizard-Vicuna-30B-Uncensored-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הרשום במאגר הוא other, ולא צוין נוסח רישיון מפורש בכרטיס המודל. המשמעות היא שאין הרשאה ברורה לשימוש מסחרי, ואי אפשר להטמיע אותו במוצר פתוח לציבור בלי לבדוק תחילה את תנאי המודל המקורי שעליו הוא מתבסס.

הרישיון המלא בעמוד המודל ↗