GPT
L

Llama-3.2-3B-Instruct-abliterated

קוד פתוח

huihui-aillama3.22024-09-28

  • transformers
  • safetensors
  • llama
  • text-generation
  • abliterated

גרסה לא מצונזרת של המודל הקטן של מטא, שעברה הסרה של מנגנוני הסירוב. מתאים למי שחייב מודל קל משקל שמבצע הוראות בלי להתווכח.

  • 3.6Bפרמטרים
  • 131,072טוקנים בהקשר
  • 6.7 GBמשקל הקבצים
  • 4,985הורדות בחודש

מה זה

מדובר בעיבוד לגרסת ההוראות של Llama 3.2 בגודל 3.6 מיליארד פרמטרים, שנוצר בטכניקה בשם abliteration. המטרה של התהליך היא לנטרל את הנטייה של המודל המקורי לסרב לבקשות, בלי לאמן אותו מחדש מאפס ובלי להרוס לו את היכולות הכלליות.

לפי המבחנים שהמפתח מציג, המהלך הזה לא פגע בביצועים. בציוני IF_Eval שבודקים מעקב אחרי הוראות הוא מקבל 76.76 לעומת 76.55 במקור, ובשאר המבחנים כמו TruthfulQA או MMLU Pro הוא שומר על תוצאות זהות כמעט לחלוטין. זה אומר שמקבלים בדיוק את אותה רמת חשיבה של מודל 3B, רק בלי מעצורים.

מתאים ל

  • עיבוד טקסט ללא סירובים

    מתאים לניתוח טקסטים בעייתיים, קללות או תוכן רגיש שמודלים רגילים מסרבים לגעת בהם.

  • הרצה מקומית על מחשב נייד

    משקל של 6.7 גיגה מאפשר להריץ אותו מקומית ב־ollama בלי שרתים ייעודיים.

  • עבודה עם הקשר ארוך

    חלון של 131 אלף טוקנים מאפשר להזין מסמכים שלמים למודל קומפקטי ומהיר.

איפה זה נופל

זה עדיין מודל של 3.6 מיליארד פרמטרים, והמגבלות של הגודל הזה ברורות. הוא מגיע רק ל־28 נקודות ב־MMLU Pro ו־GPQA, כלומר שאלות מורכבות, ניתוח עמוק או משימות שדורשות היגיון רב פשוט לא יעבדו טוב. בנוסף, הסרת הסירובים מוחלטת. המודל יענה על הכל, ולכן אסור לחבר אותו למוצר מול משתמשי קצה בלי שכבת סינון ובקרה משלכם.

שאלות
נפוצות

האם המודל חכם יותר מ־Llama 3.2 הרגיל?

לא. המדדים מראים הבדלים אפסיים לעומת המקור, כמו עשירית אחוז בודדת במבחנים. השינוי היחיד הוא שהוא לא מסרב לפקודות.

איך הכי קל להריץ אותו מקומית?

הכי פשוט להשתמש ב־ollama ולהריץ ישירות את huihui_ai/llama3.2-abliterate. מי שרוצה שליטה מלאה יכול להוריד את הקבצים מ־huggingface ולקמפל קובץ קוונטיזציה בעצמו לפי ההוראות.

איך מריצים

המשקל המלא בדיוק bfloat16 תופס 6.7 גיגה בייט, כך שכרטיס מסך בסיסי או מחשב נייד מודרני מריצים אותו בלי להזיע. אפשר להוריד אותו ישירות דרך הספרייה של transformers או למשוך גרסה מוכנה לשימוש בתוך ollama בפקודה אחת.

היוצר מסביר גם איך לקחת את המשקלים הגולמיים ולכווץ אותם לקוונטיזציה של q4_K_M בעזרת Modelfile. אם יש לכם צרכים פשוטים ומעט משאבים, הרצה מקומית כזו עדיפה על תשלום ל־API חיצוני, במיוחד כשרצים על חומרה צנועה.

from transformers import pipeline

pipe = pipeline("text-generation", model="huihui-ai/Llama-3.2-3B-Instruct-abliterated")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון llama3.2 של מטא. מותר להשתמש בו לצרכים מסחריים ופיתוח פנימי, אבל כפופים להגבלות השימוש המקוריות של מטא, כולל תנאי היקף משתמשים חודשיים והנחיות שימוש מקובל.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗