GPT
L

Llama-2-7B-GGUF

קוד פתוח

TheBlokellama22023-09-04

  • transformers
  • gguf
  • llama
  • facebook
  • meta

גרסה מכווצת בפורמט GGUF למודל הבסיס של מטא, שמיועדת להרצה מקומית על מעבדים ביתיים וכרטיסי מסך צנועים.

  • 47.7 GBמשקל הקבצים
  • 16,502הורדות בחודש
  • 207לייקים

מה זה

מדובר במודל הבסיס של שבעה מיליארד פרמטרים מבית מטא, שעבר המרה לפורמט GGUF על ידי TheBloke. הוא אומן על שני טריליון טוקנים עם חלון הקשר של 4,096 טוקנים, ותפקידו הוא השלמת טקסט חופשית ולא שיחה. אין כאן כוונון להוראות, ולכן הוא מקבל קלט ישיר וממשיך אותו הלאה.

במבחני הבנצ'מרק האקדמיים הוא עוקף את הדור הראשון של אותה סדרה בכל תחום. הוא קיבל ציון של 45.3 ב־MMLU לעומת 35.1 בקודמו, ורשם 16.8 במבחני קוד לעומת 14.1. עם זאת, התוצאה הזו במתמטיקה ובקוד נמוכה מאוד ביחס לאחיו הגדולים בסדרה שמגיעים לעשרות אחוזים יותר, כך שהוא לא מתאים למשימות פיתוח מורכבות.

מתאים ל

  • השלמת טקסטים באנגלית

    מתאים לכתיבה יוצרת או יצירת המשכים לפסקאות קיימות, בזכות מבנה הבסיס שאינו מוגבל לשיחה.

  • אימון מקומי ומחקר

    משמש בסיס טוב לבדיקת התאמות אישיות על חומרה ביתית קלה לפני מעבר למודלים כבדים.

  • מערכות ללא חיבור רשת

    רץ ישירות על מעבד ומאפשר עבודה בסביבות פיתוח סגורות בלי לשלוח נתונים החוצה.

איפה זה נופל

הקובץ הזה מכיל את מודל הבסיס בלבד ולא את גרסת הצ'אט. אם תתנו לו שאלה בלי תבנית מתאימה, הוא לא יענה אלא ינסה להמשיך לחבר טקסט. במבחן TruthfulQA המודל הזה הוציא 33.29 בלבד, מה שמצביע על נטייה גבוהה להזיות ביחס לגרסאות המכווננות שמגיעות ל־57.

הוא מוגדר מראש לשפה האנגלית בלבד, ואימון המקור שלו נעצר בספטמבר 2022. קוד ומספרים הם נקודת תורפה ברורה עם 14.6 בלבד במבחני מתמטיקה. מי שמחפש מערכת שמבינה עברית או עוזר שעונה לבקשות, לא יכול להשתמש בקובץ הזה כפי שהוא.

אותה משפחה

Llama-2 יצא ב־17 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל הזה יודע לענות על שאלות כמו צ'אטבוט?

לא. מדובר במודל בסיס שנועד להשלים משפטים, ולא בגרסת הצ'אט שעברה התאמה להוראות. אם תשאלו אותו שאלה, הוא לרוב ימציא שאלות המשך במקום לספק תשובה ישירה.

איזה קובץ ספציפי כדאי להוריד מתוך הרשימה?

הגרסה המומלצת לרוב השימושים היא Q4_K_M ששוקלת 4.08 גיגה בייט. היא שומרת על איזון סביר בין איבוד איכות לבין צריכת זיכרון של כ־6.6 גיגה בייט בעבודה שוטפת.

איך מריצים

המודל הזה רץ דרך llama.cpp, ספריות פייתון כמו ctransformers, או ממשקים גרפיים מקומיים כמו LM Studio. משקל הקבצים מתחיל ב־2.83 גיגה בייט בגרסת Q2_K ומגיע עד 7.16 גיגה בייט בגרסת Q8_0, כשהדרישה לזיכרון RAM ללא פריקה למעבד גרפי נעה בין 5.33 ל־9.66 גיגה בייט בהתאמה. הגרסה המאוזנת והמומלצת בכרטיס היא Q4_K_M שדורשת 6.58 גיגה בייט זיכרון.

אפשר לטעון את השכבות לכרטיס מסך כדי להאיץ את התהליך, או להריץ על מעבד רגיל בלבד. אם יש לכם מחשב עם פחות משמונה גיגה בייט זיכרון פנוי, עדיף להשתמש בשרותי ענן חיצוניים כי הביצועים המקומיים יקרסו.

ollama run hf.co/TheBloke/Llama-2-7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון llama2 הייעודי של מטא, והוא מאפשר שימוש מסחרי ומחקרי באנגלית תחת תנאי השימוש ומדיניות החברה. הוא מחייב קבלת תנאי הרישיון המקוריים באתר של מטא כדי להוריד את המשקולות, ודורש בדיקות בטיחות עצמאיות לפני שילוב המודל בכל מוצר פעיל.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗