GPT
L

Llama-3.2-3B-Uncensored-GGUF

קוד פתוח

lemuralabsapache-2.02024-12-05

  • adapter-transformers
  • gguf
  • chemistry
  • biology
  • legal

גרסה נטולת הגבלות בטיחות של מודל Llama 3.2 בגודל 3 מיליארד פרמטרים. היא פונה למי שצריך מודל קומפקטי שמסוגל לענות על כל הנחיה בלי לסרב או להטיף מוסר.

  • 35.6 GBמשקל הקבצים
  • 13,609הורדות בחודש
  • 49לייקים

מה זה

המודל מבוסס על הארכיטקטורה הקומפקטית של מטא, אך עבר אימון ייעודי על נתונים נטולי סינון, דאטה לקונטקסט ארוך, RAG ופתרון בעיות מתמטיות. המטרה של הצוות הייתה להסיר לחלוטין את מגבלות התוכן המובנות, כך שהוא מספק תשובות ישירות גם לשאלות שבדרך כלל נחסמות.

בבנצ'מרקים המדווחים בכרטיס, המודל מציג שיפור נקודתי על פני המקור. במבחן GPQA דיוק התשובות עולה מ־0.4 ל־0.5, ובמבחן HellaSwag שמודד היגיון בסיסי והשלמת משפטים הדיוק עולה מ־0.3 ל־0.4. בפועל, המשמעות היא שהסרת הסינונים לא ריסקה את איכות התשובה, והמודל שומר על יציבות סבירה במשימות ידע כללי.

מתאים ל

  • כתיבה יצירתית ללא צנזורה

    מתאים לסיפורים ודיאלוגים מורכבים שבהם מודלים רגילים נחסמים עקב תכנים בוגרים או קונפליקטים.

  • עוזר מקומי למכשירים חלשים

    מאפשר הרצה מקומית מלאה ומהירה על מחשבים ניידים פשוטים בלי תלות בחיבור רשת.

  • אימון RAG למאגרים רגישים

    עבר כוונון ייעודי לשליפת מידע ומענה ישיר על שאלות ללא חסימות מערכת.

איפה זה נופל

גודל של 3 מיליארד פרמטרים מטיל מגבלות פיזיקליות על עומק החשיבה. המודל עלול להמציא עובדות בביטחון מלא, ובגלל היעדר מנגנוני סינון, אין שום רשת ביטחון שתמנע ממנו לפלוט תוכן רעיל, פוגעני או מטעה. הכרטיס אינו מציג נתונים לגבי תמיכה בשפות שאינן אנגלית, ולכן לא הייתי מסתמך עליו בעיבוד טקסט בעברית בלי בדיקה מעמיקה מראש.

שאלות
נפוצות

האם המודל תומך בעברית בצורה טובה?

הכרטיס לא מפרט נתונים על שפות נוספות מעבר לאנגלית. מודלים בגודל 3B לרוב מקרטעים בעברית מורכבת, ולכן מומלץ לבדוק אותו מקומית על טקסטים קצרים לפני שמתכננים מוצר.

האם חייבים כרטיס מסך ייעודי כדי להפעיל אותו?

לא. גרסאות מכוילות כמו Q4 שוקלות ג'יגה בייטים בודדים ויכולות לרוץ במהירות טובה גם על גבי מעבד רגיל בלבד דרך llama.cpp.

איך מריצים

המשקל הכולל בריפו מגיע ל־35.6 ג'יגה בייט רק בגלל שהוא מכיל 19 קבצים שונים, אך בפועל מורידים רק קובץ GGUF בודד. בגלל שמדובר במודל של 3 מיליארד פרמטרים בלבד, גרסת Q4_K_M או Q5_K_M תרוץ בקלות על כל מעבד מודרני או כרטיס מסך בסיסי עם 4 עד 6 ג'יגה בייט של זיכרון.

אם יש צורך ברמת דיוק מקסימלית, קובץ F16 המלא דורש כרטיס מסך חזק יותר. עם זאת, אם אתם מחפשים מענה למשימות שפה מורכבות בעברית או ניתוח קוד עמוק, שום כיול של מודל 3B לא יחליף פנייה ל־API של מודלים ענקיים.

ollama run hf.co/lemuralabs/Llama-3.2-3B-Uncensored-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון המדווח הוא Apache 2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי קוד והפצה חופשית, בתנאי ששומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי בתוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗