GPT
L

Luna-AI-Llama2-Uncensored-GGUF

קוד פתוח

TheBlokecc-by-sa-4.02023-09-06

  • transformers
  • gguf
  • llama

גרסת GGUF שעברה כיול להסרת מגבלות תוכן ומבוססת על שיחות צ'אט ארוכות. היא מיועדת למי שצריך מודל לשיחה חופשית מקומית בלי סינונים תאגידיים מובנים.

  • 47.7 GBמשקל הקבצים
  • 7,756הורדות בחודש
  • 73לייקים

מה זה

מדובר במודל צ'אט שהתאמן על בסיס Llama 2 בעזרת יותר מ־40,000 שיחות ארוכות ומרובות שלבים, שנוצרו באופן סינתטי בין אדם למכונה. היוצר המקורי, Tap, אימן אותו על גבי שרת של שמונה כרטיסי A100 כדי לבטל את מנגנוני הסירוב הרגילים של מטא. TheBloke לקח את המשקלים והמיר אותם לפורמט GGUF להרצה במגוון דרגות קוונטיזציה.

במדדים היבשים הוא רושם דיוק של 0.5512 במבחן arc_challenge, ציון של 0.46521 ב־MMLU וציון של 0.4716 ב־truthfulqa_mc, עם ממוצע כולל של 0.5114. המספרים האלה מראים ביצועים בינוניים למדי בידע כללי ובהבנה מורכבת. הדגש כאן הוא לא יכולת אנליטית עמוקה, אלא נכונות לענות על בקשות וסגנון שיחה שוטף במבנה של משתמש ועוזר.

מתאים ל

  • סימולציות ומשחקי תפקידים

    התאמה טובה לדיאלוגים בדיוניים ללא סירובים שקוטעים את הזרימה העלילתית.

  • מחקר אבטחה ובדיקות חוסן

    בדיקת תרחישי תקיפה ובחינת גבולות של מודלים פתוחים ללא הגבלות תוכן מובנות.

  • צ'אט אישי לא מקוון

    הרצה מקומית על מחשב נייד בסיסי בעזרת קובץ Q4_K_M הדורש פחות מ־7 ג'יגה זיכרון.

איפה זה נופל

המודל מוגדר מראש כנטול צנזורה, מה שאומר שהוא מייצר תוכן בוטה, שגוי או פוגעני בלי מעצורים. במבחן truthfulqa_mc הוא קיבל 0.4716 בלבד, כך שהסיכוי להזיות ולתשובות מומצאות מורגש בהחלט. הוא גם לא מציג נתונים במבחן hellaswag בכרטיס המקורי. חובה לבנות שכבת בדיקות וסינון עצמאית לפני שחושפים אותו למשתמשי קצה בעולם האמיתי.

אותה משפחה

Luna-AI-Llama2-Uncensored יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ להוריד מתוך המאגר בלי להעמיס על המחשב?

הקובץ המתאים לרוב המקרים הוא luna-ai-llama2-uncensored.Q4_K_M.gguf. הוא שוקל 4.08 ג'יגה בייט ודורש 6.58 ג'יגה בייט של זיכרון עבודה בהרצה על מעבד, ומספק פשרה טובה בין איכות הטקסט למהירות התגובה.

איזה מבנה פנייה נדרש לקבלת תשובה תקינה?

המודל מאומן על פורמט Vicuna 1.1 ודורש פנייה קבועה של USER ולאחריה רווח והטקסט שלכם, ואז שורה חדשה עם ASSISTANT. סטייה מהתבנית הזו תפגע באיכות הפלט ותגרום לחזרות מיותרות.

איך מריצים

הקבצים מכסים טווח רחב של דיוקים, מגרסאות Q2_K רזות ועד Q8_0 מלאה ששוקלת 7.16 ג'יגה בייט ודורשת 9.66 ג'יגה בייט זיכרון עבודה. הקובץ המאוזן והמומלץ לרוב המפתחים הוא Q4_K_M. הוא שוקל 4.08 ג'יגה בייט ומסתפק ב־6.58 ג'יגה בייט זיכרון, כך שאפשר להריץ אותו בקלות על מעבד רגיל או לדחוף את כל 32 השכבות שלו לכרטיס מסך בסיסי עם 8 ג'יגה בייט זיכרון גרפי.

אפשר לטעון אותו בעזרת llama.cpp, כלי ממשק כמו LM Studio או תוכנת טקסט ווב, וגם בספריות קוד כמו llama-cpp-python ו־ctransformers. אם אתם צריכים תפוקה יציבה לייצור מסחרי בעומס גבוה בלי להתעסק בתחזוקת שרתים מקומיים, עדיף לפנות לממשק ענן מנוהל.

ollama run hf.co/TheBloke/Luna-AI-Llama2-Uncensored-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מורכב ומציב סיכון משפטי מסוים. המאמן Tap רשם אותו תחת רישיון פתוח cc-by-sa-4.0 שדורש ייחוס ושיתוף זהה, אך מכיוון שהוא מבוסס על Llama 2, חלים עליו במקביל גם תנאי השימוש של חברת Meta. Hugging Face טרם סיפקו עמדה רשמית לגבי השילוב הזה, כך שלפני שילוב במוצר מסחרי צריך לבדוק את שני הרישיונות מול המאגר המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא בעמוד המודל ↗