GPT
L

Llama-2-13B-chat-GGUF

קוד פתוח

TheBlokellama22023-09-04

  • transformers
  • gguf
  • llama
  • facebook
  • meta

גרסה מכווצת של המודל מבית מטא שמתאימה להרצה על מעבדים ביתיים וכרטיסי מסך קטנים. מיועדת למי שצריך צ'אט סביר באנגלית בלי לשלם על שרתים יקרים.

  • 91.9 GBמשקל הקבצים
  • 8,629הורדות בחודש
  • 206לייקים

מה זה

מטא אימנה את הדגם הזה על 2 טריליון טוקנים, והגרסה כאן עברה כיווץ לפורמט GGUF בידי TheBloke. זהו דגם שיחה עם 13 מיליארד פרמטרים שעבר אימון ייעודי בעזרת משוב אנושי כדי להפיק תשובות בטוחות ותמציתיות. הוא אמור לספק פתרון ביניים סביר בין גרסת ה־7B הקלה לבין גרסת ה־70B הכבדה.

במבחני ביצועים, דגם ה־13B רושם 54.8 ב־MMLU ו־28.7 במתמטיקה. המשמעות היא שיפור מורגש על פני הדור הראשון וגרסת ה־7B, אבל לא מדובר ביכולת ניתוח עמוקה או כתיבת קוד מתקדמת, שם הוא משיג רק 24.5. הוא מיועד בעיקר לשיחה בסיסית, סיכום טקסטים ומענה עובדתי מוגדר באנגלית.

מתאים ל

  • בוט שיחה מקומי באנגלית

    אימון ה־RLHF מאפשר מענה מנומס ועקבי בלי תלות ברשת, מתאים למחשבים אישיים.

  • סיכום פסקאות קצרות

    גודל 13B מספיק לחילוץ נקודות מרכזיות מטקסט מוגבל של כמה עמודים.

  • מענה על שאלות מוגדרות

    הוא ממושמע במעקב אחר הנחיות מערכת נוקשות כל עוד מספקים לו את המידע בפרומפט.

איפה זה נופל

המודל הזה לא מיועד לעברית. הכרטיס מציין במפורש תמיכה באנגלית בלבד, וכל שימוש בשפות אחרות נחשב מחוץ לתחום שהוגדר. בנוסף, חלון ההקשר עומד על 4,096 טוקנים בלבד, מה שמגביל מאוד הזנה של מסמכים ארוכים או ניהול שיחות ממושכות.

הוא גם דורש תבנית פרומפט נוקשה מאוד עם תגיות מיוחדות כמו INST כדי שלא יאבד כיוון. נקודת החיתוך של המידע היא ספטמבר 2022, למעט חלק מנתוני האימון שעודכנו עד יולי 2023.

אותה משפחה

Llama-2 יצא ב־17 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם צריך להוריד את כל 18 הקבצים מהמאגר?

ממש לא. המאגר מכיל רמות כיווץ שונות של אותו מודל, ואתם צריכים לבחור קובץ אחד בלבד. ההמלצה היא להוריד את Q4_K_M שנותן פשרה טובה בין משקל של כמעט 8 גיגה לאיכות הפלט.

האם אפשר להשתמש בו לאפליקציה בעברית?

הדגם אומן ונבדק באנגלית בלבד, והיוצרים מגדירים שפות אחרות כשימוש לא נתמך. הוא עלול לפלוט עברית משובשת, לקטוע משפטים או להמציא מילים לחלוטין.

איך מריצים

אתם צריכים מחשב עם 8 עד 16 גיגה זיכרון כדי להריץ את הקבצים האלה. אם עובדים על מעבד בלבד, גרסת Q4_K_M דורשת כ־10.4 גיגה זיכרון פנוי ושוקלת 7.87 גיגה, וזו נקודת ההתחלה המאוזנת. אפשר להוריד קובץ בודד ולהריץ אותו דרך llama.cpp, תוכנות כמו LM Studio, או בספריות פייתון כמו ctransformers.

אם יש לכם כרטיס מסך עם לפחות 10 גיגה VRAM, אפשר לזרוק אליו את השכבות כדי לקבל קצב סביר. בלי כרטיס מסך מתאים, המעבד יסחוב, אבל אל תצפו למהירות גבוהה.

ollama run hf.co/TheBloke/Llama-2-13B-chat-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון מותאם אישית של מטא עבור Llama 2. הוא מתיר שימוש מסחרי ומחקרי, אבל מחייב כפיפות לתנאי השימוש המקוריים שלהם ולהנחיות הבטיחות. מי שמפתח מוצר צריך לאשר את הרישיון ישירות מול מטא ולוודא שהשימוש מוגבל לאנגלית ועומד בהגבלות החוקיות.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗