GPT
L

Llama-2-13B-GGUF

קוד פתוח

TheBlokellama22023-09-04

  • transformers
  • gguf
  • llama
  • facebook
  • meta

גרסת GGUF מכווצת למודל הבסיס של מטא עם 13 מיליארד פרמטרים. היא מתאימה למי שרוצה להריץ מודל טקסט מקומית על מעבד או כרטיס מסך ביתי בלי תלות ברשת.

  • 91.9 GBמשקל הקבצים
  • 1,888הורדות בחודש
  • 70לייקים

מה זה

מטא אימנה את מודל הבסיס הזה על שני טריליון טוקנים, והמשתמש TheBloke המיר אותו לקובצי GGUF שמיועדים להרצה ישירה דרך ספריות כמו llama.cpp. זהו מודל גנרטיבי נקי ולא גרסת צ'אט שעברה התאמה להוראות. הוא ממשיך טקסטים קיימים ומתאים לכוונון המשך או משימות סיווג, עם חלון הקשר של 4096 טוקנים.

במדדי ביצועים הוא מציג שיפור עקבי מול הדור הראשון של מודלי 13B. במבחן MMLU הוא עומד על 54.8 לעומת 46.9 בדור הקודם, ובמתמטיקה קפץ מציון 10.9 לציון 28.7 בבנצ'מרק GSM8K ו־MATH. בתכנות הוא עדיין חלש יחסית עם ציון 24.5 בלבד במבחני HumanEval ו־MBPP, כך שהוא לא בנוי לכתיבת קוד מורכב.

מבחינת בטיחות ואמינות, במדד TruthfulQA המודל הגיע ל־41.86 אחוז תשובות נכונות, ומדד הרעילות Toxigen עומד על 26.1 אחוז. התוצאות האלה משקפות מודל בסיס גולמי שלא עבר סינון שיחות אנושי.

מתאים ל

  • השלמת טקסטים באנגלית

    הוא אומן על שני טריליון טוקנים ומצטיין בהמשך ישיר של משפטים, פסקאות ומסמכים קיימים.

  • אימון וכוונון מקומי

    מתאים כמנוע בסיס ליצירת גרסאות מותאמות אישית למשימות טקסט צרות בלי תלות בצד שלישי.

  • סיווג מסמכים פנימי

    רץ מקומית דרך llama.cpp ומאפשר ניתוח נתונים רגישים בלי לשלוח מידע לרשת.

איפה זה נופל

הקוד וההדרכה מוגדרים רשמית לשפה האנגלית בלבד, וכל שימוש בעברית או בשפות אחרות מוגדר כחריגה מהייעוד ולא נתמך. המודל מתבסס על נתונים שנאספו עד ספטמבר 2022, ולכן הוא חסר כל מידע על אירועים מאוחרים יותר.

זהו מודל בסיס ללא תבנית שיחה (Prompt Template: None), ולכן הוא אינו עונה לשאלות כעוזר אישי אלא מנסה להשלים את הטקסט שקיבל. אם תזינו לו שאלה ישירה, הוא עלול להמשיך ברשימת שאלות במקום לענות.

אותה משפחה

Llama-2 יצא ב־17 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לצ'אט בסגנון ChatGPT?

לא מומלץ. זהו מודל בסיס להשלמת טקסט ולא גרסת Chat שעברה כוונון מונחה הוראות (RLHF). כדי לקבל עוזר שמנהל דיאלוג, עדיף להוריד ישירות את גרסת ה־Chat של המודל.

איזה קובץ בדיוק צריך להוריד מתוך ה־18 שקיימים?

לא מורידים את כל המאגר. לרוב השימושים כדאי לבחור בקובץ llama-2-13b.Q4_K_M.gguf, ששוקל 7.87 גיגה בייט ומספק יחס מצוין בין איכות התוצאה לצריכת זיכרון.

איך מריצים

קובצי המודל נעים בין 5.43 גיגה בייט בכימוס של 2 ביט ועד 13.83 גיגה בייט בגרסת 8 ביט. לריצה מאוזנת של ביצועים ואיכות, הגרסה המומלצת היא Q4_K_M במשקל 7.87 גיגה בייט, שדורשת כ־10.37 גיגה בייט זיכרון עבודה בהרצה על מעבד בלבד, או כרטיס מסך מודרני עם לפחות 12 גיגה בייט זיכרון כדי לפרוק אליו את כל השכבות.

מריצים אותו ישירות מתוך llama.cpp, ממשקים גרפיים כמו LM Studio ו־text-generation-webui, או בקוד פייתון בעזרת ספריית ctransformers עם פקודת AutoModelForCausalLM. אם אין לכם מחשב עם 16 גיגה בייט זיכרון פנוי או מאיץ גרפי מתאים, עדיף לצרוך מודל כזה דרך ספקי API מוכנים כדי להימנע מאיטיות חריפה בריצה על המעבד.

ollama run hf.co/TheBloke/Llama-2-13B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון llama2 של מטא. הוא מתיר שימוש מסחרי ומחקרי חופשי, אך דורש עמידה במדיניות השימוש המקובלת שלהם, אישור תנאי הרישיון באתר מטא לפני ההורדה, ואינו מתיר שימוש בשפות שאינן אנגלית.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗