GPT
V

vicuna-13b-free

קוד פתוח

reeducatorרישיון לא דווח2023-04-14

  • transformers
  • llama
  • text-generation
  • en
  • endpoints_compatible

גרסה לא מצונזרת של ויקוניה 13B שמנסה לענות על כל שאלה בלי לחסום נושאים רגישים. מיועדת למי שמחפש מודל שיחה באנגלית שלא מסרב לבקשות.

  • 2,048טוקנים בהקשר
  • 88.4 GBמשקל הקבצים
  • 72הורדות בחודש
  • 130לייקים

מה זה

מדובר בהתאמה של Vicuna 1.1 בגודל 13 מיליארד פרמטרים, שאומנה על דאטה-סט לא מסונן מגרסת מאי 2023. המטרה המרכזית כאן היא להסיר את מגבלות התוכן והסירוב הרגילות שקיימות בגרסאות הבסיס, כך שהוא לא ידחה פניות סביב נושאים שנויים במחלוקת או רגישים.

המשקלים המקוריים מגיעים בדיוק של float32 ולכן שוקלים מעל 88 ג'יגה-בייט, שזה חריג וכבד מאוד להורדה ולטעינה ישירה עבור מודל 13B. הוא מיועד ליצירת טקסט ושיחה באנגלית בלבד, עם חלון הקשר קצר של 2,048 טוקנים שתואם את ארכיטקטורת LLaMA המקורית מ־2023.

מתאים ל

  • מחקר על מודלים לא מצונזרים

    הוא נבנה במיוחד כדי לבחון איך מודל שיחה מגיב לפניות רגישות ללא מנגנוני סירוב מובנים.

  • שיחה חופשית באנגלית בלוקאל

    הוא מציע תגובות מפורטות ללא חסימות תוכניות, כל עוד מריצים אותו מקומית בגרסאות מכווצות.

  • ניסויי התאמת פרומפטים

    הוא מגיב לפרומפט מערכת מותאם וקבוע שמאפשר לבדוק שינויים בהתנהגות הטוקנים והפלט.

איפה זה נופל

היוצר מציין במפורש שהפרויקט נמצא בעבודה ושיכולות להיות בעיות צנזורה או פגמים אחרים בפלט. בנוסף, יש בו באג מוכר של חיתוך מוקדם עם טוקן סיום, שמחייב הוספת הוראה מיוחדת בסוף הפרומפט כדי למנוע ממנו לייצר הודעות מערכת או לעצור מוקדם מדי. חלון ההקשר עומד על 2,048 טוקנים בלבד, והאימון הוא באנגלית בלבד ללא שום התאמה לעברית.

שאלות
נפוצות

למה הקבצים שוקלים 88.4 ג'יגה-בייט למודל של 13B?

המשקלים נשמרו בדיוק מלא של float32 במקום float16 הרגיל, מה שמכפיל את הנפח ללא תועלת אמיתית באיכות. בפועל אין היגיון להריץ אותו ככה, ועדיף להשתמש בגרסאות ה־GGML או ה־GPTQ שצוינו בדף.

איך עוקפים את הבאג של עצירת הטקסט באמצע התשובה?

בכרטיס המודל מוסבר שצריך להוסיף לסוף הפרומפט שורת מערכת שמורה לו לא לייצר את טוקן הסיום ולא לייצר הודעות SYSTEM. זהו מעקף זמני שמפחית את תדירות התקלה.

איך מריצים

כדי להריץ את הקבצים המקוריים בדיוק המלא צריך נפח אחסון וזיכרון עבודה עצומים שלא מצדיקים את הביצועים של 13B. בפועל עדיף לעבוד עם גרסאות מכווצות שמוזכרות בכרטיס, כמו קובצי GGML ב־f16 או q5_0 דרך llama.cpp, או קובץ GPTQ של 4 ביט שמיועד לכרטיסי מסך של אנבידיה עם זיכרון וידאו צנוע בהרבה.

המודל דורש פורמט שיחה מיוחד כדי לשמור על עקביות, כולל פרומפט מערכת ארוך שמנחה אותו במפורש לענות תמיד ולא לסרב לשום בקשה.

from transformers import pipeline

pipe = pipeline("text-generation", model="reeducator/vicuna-13b-free")
print(pipe("שלום"))

הרישיון

היוצר לא דיווח על רישיון כלשהו בכרטיס המודל. במצב כזה, מבחינה משפטית אין הרשאה ברורה להשתמש בו לצרכים מסחריים או לשלב אותו במוצר שמפיצים החוצה, ומסוכן להסתמך עליו בסביבה עסקית.

הרישיון המלא בעמוד המודל ↗