GPT
L

Llama-2-7B-Chat-GGUF

קוד פתוח

TheBlokellama22023-09-04

  • transformers
  • gguf
  • llama
  • facebook
  • meta

גרסת GGUF מכווצת של Llama 2 7B מיועדת למי שרוצה להריץ צ'אט בוט מקומי על מעבד או כרטיס מסך ביתי בלי ענן.

  • 47.7 GBמשקל הקבצים
  • 47,376הורדות בחודש
  • 518לייקים

מה זה

מטא אימנה את הדגם הזה על 2 טריליון טוקנים, והגרסה הזו עברה כווץ מובנה לפורמט GGUF כדי לאפשר ריצה מהירה בספריות כמו llama.cpp. הדגם עבר אימון ייעודי לשיחות בעזרת משוב אנושי, והוא כולל חלון הקשר של 4,096 טוקנים.

במבחני ביצועים מול הדור הראשון של Llama, גרסת 7B מציגה שיפור מסוים. בבחינת MMLU הציון עלה מ־35.1 ל־45.3, ובמבחני מתמטיקה התוצאה קפצה מ־6.95 ל־14.6. בפועל, הוא עונה בצורה מסודרת יותר לשאלות יומיומיות, אבל עדיין מתקשה במשימות היגיון מורכבות לעומת הדגמים הגדולים יותר בסדרה.

מתאים ל

  • בוט שירות לקוחות מקומי

    מתאים לשיחה באנגלית במחשב פנימי בארגון ללא הוצאת נתונים לרשת.

  • סיווג טקסטים קצרים

    קל להרצה על מעבד רגיל לצורך מיון מהיר של מסמכים באנגלית.

  • עוזר שיחה למערכות משובצות

    צורך מעט משאבים בגרסאות המכווצות ומתאים לחומרה מוגבלת.

איפה זה נופל

המודל אומן על טקסט באנגלית בלבד. כל ניסיון לנהל איתו שיחה בעברית ייכשל או יניב פלטים משובשים, והיוצרים הגדירו שימוש בשפות אחרות מחוץ לטווח המותר. בנוסף, חיתוך הנתונים שלו נעצר בספטמבר 2022 למידע כללי ויולי 2023 לנתוני הכוונון. הוא חלש מאוד בכתיבת קוד עם ציון של 16.8 בלבד במבחני תכנות, ודורש שמירה קפדנית על תבנית הפרומפט המקורית כדי לא להתבלבל.

אותה משפחה

Llama-2 יצא ב־17 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. הכרטיס מציין שהמודל יועד לאנגלית בלבד, וכל שפה אחרת הוגדרה מחוץ לתחום השימוש. פלט בעברית יהיה שבור ולא מדויק.

איזה קובץ הכי כדאי להוריד מהרשימה?

הקובץ המומלץ לרוב השימושים הוא Q4_K_M. הוא שוקל כ־4.08 גיגה-בייט ומספק איזון נכון בין איכות הפלט לצריכת הזיכרון.

האם צריך כרטיס מסך מיוחד כדי להפעיל אותו?

אין חובה להשתמש בכרטיס מסך. קובצי GGUF מתוכננים לרוץ גם על מעבד רגיל, כל עוד יש במחשב מספיק זיכרון פנוי בהתאם לגרסה שנבחרה.

איך מריצים

משקל הקבצים מתחיל ב־2.83 גיגה-בייט בגרסת שתי ביט ומגיע עד 7.16 גיגה-בייט בגרסת שמונה ביט. להרצה פשוטה על מעבד ללא מאיץ גרפי, גרסת Q4_K_M שוקלת 4.08 גיגה-בייט ודורשת לפחות 6.58 גיגה-בייט זיכרון עבודה. אם יש לכם כרטיס מסך, אפשר להעביר שכבות לזיכרון הגרפי כדי להאיץ את התגובה.

אפשר להריץ את הקבצים ישירות דרך llama.cpp, תוכנות שולחניות כמו LM Studio, או בסקריפט פייתון עם ctransformers. שווה להשקיע בהרצה מקומית רק אם יש צורך בפרטיות מוחלטת או פעולה ללא אינטרנט. אחרת, פנייה ל־API חיצוני תחסוך את כאב הראש של ניהול זיכרון וביצועים מוגבלים.

ollama run hf.co/TheBloke/Llama-2-7B-Chat-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

השימוש כפוף לרישיון Llama 2 המותאם של מטא. הוא מאפשר שימוש מסחרי ומחקרי, אך מחייב לקבל את תנאי השימוש הרשמיים באתר החברה. הרישיון אוסר מפורשות על הפעלת המודל בשפות שאינן אנגלית או שימוש המפר את מדיניות השימוש המקובלת.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗