GPT
L

Llama-2-13B-chat-GGML

קוד פתוח

TheBlokeother2023-07-18

  • transformers
  • llama
  • facebook
  • meta
  • pytorch

גרסת צ'אט מכווצת של מטא שרצה ישירות על מעבד ומאיצי חומרה ביתיים. הבחירה בה הגיונית רק אם אתם מחזיקים בסביבה ישנה שכבר נעולה על פורמט הקבצים הזה.

  • 109 GBמשקל הקבצים
  • 178הורדות בחודש
  • 693לייקים

מה זה

המאגר הזה מחזיק שורת גרסאות של מודל השיחה מבית מטא, אחרי שעברו כיול והקטנה לפורמט GGML בידי TheBloke. מדובר במודל שפה שאומן על שני טריליון טוקנים, כאשר גרסת השיחה עברה כוונון מונחה עם למידת חיזוק על בסיס משוב אנושי. בבנצ'מרקים המקוריים הוא הציג שיפור ניכר מול הדור הראשון, עם ציון MMLU של 54.8 לעומת 46.9, ומדד דיוק של 24.5 במבחני קוד מול 18.9 בעבר. במבחני בטיחות ורעילות כמו ToxiGen גרסת הצ'אט הזו קיבלה 0.00, מה שמבטיח סינון הדוק מאוד של תכנים בעייתיים אבל גם מוביל לעיתים לסירובי סרק לטקסטים לגיטימיים.

הייחוד בגרסה המסוימת הזו הוא אופן האריזה שלה למערכות אישיות. היא נבנתה במקור כדי לאפשר לאנשים פרטיים ולחברות להריץ מודל סביר בלי צורך בשרתי ענן מנופחים. יחד עם זאת, הפורמט עצמו ננטש לחלוטין באוגוסט 2023 לטובת GGUF. המשמעות היא שאתם מורידים קובץ קפוא בזמן, שמתאים רק למי שכבר כבול לתשתיות היסטוריות או לתוכנות ישנות שלא יודעות לקרוא קבצים עדכניים.

מתאים ל

  • עבודה עם מערכות לגאסי

    שילוב בשרתים שעדיין תקועים על ספריות ישנות של ctransformers מלפני אוגוסט 2023 ללא אפשרות שדרוג.

  • בוט שיחה מקומי באנגלית

    צ'אט שרץ על מחשב נייד ללא חיבור רשת וללא תלות בספקי ענן, עבור ניסוחים באנגלית בלבד.

  • בדיקות אוטומציה פנימיות

    סביבת פיתוח מקומית לבדיקת פקודות וסימולציות שיחה שלא דורשות ידע עדכני או תמיכה בריבוי שפות.

איפה זה נופל

הפורמט GGML מת לחלוטין. התוכנה הראשית שמריצה אותו, llama.cpp, ביטלה את התמיכה בו באוגוסט 2023, כך שגרסאות מודרניות פשוט ידחו את הקובץ. חלון ההקשר מוגבל ל־4,096 טוקנים בלבד, מה שמקשה על עיבוד מסמכים ארוכים.

בנוסף, המודל אומן ונבדק על השפה האנגלית בלבד, ואינו מיועד לשפות אחרות. אל תצפו ממנו להבין עברית או לנסח בה משפטים הגיוניים. הכרטיס מודה מפורשות שהאימון הסתיים בין ינואר ליולי 2023, והנתונים נחתכו בספטמבר 2022, לכן אין לו מושג לגבי שום דבר שקרה מאז.

שאלות
נפוצות

האם אפשר להריץ את הקבצים האלה עם llama.cpp העדכני ביותר?

לא. התמיכה בפורמט GGML הוסרה מהספרייה הזו ב־21 באוגוסט 2023. אם תנסו לטעון אותם בגרסה חדשה תקבלו שגיאה, ויש להשתמש בקומיט dadbed99e65252d79f81101a392d0d6497b86caa או להוריד קובץ בפורמט GGUF.

האם המודל יצליח לענות לי בצורה טובה בעברית?

לא מומלץ לבנות על זה. המודל הוגדר ונבדק באנגלית בלבד, וכל שימוש בשפה אחרת מוגדר על ידי מטא כחריגה מייעוד המודל. הניסוחים בעברית יהיו משובשים או שבורים.

כמה זיכרון עבודה צריך בפועל כדי לקבל ביצועים סבירים?

עבור הקובץ הפופולרי q4_K_M תצטרכו לפחות 10.37 גיגה בייט של זיכרון פנוי למעבד, או כרטיס מסך עם לפחות 12 גיגה בייט VRAM. שימוש בגרסאות קטנות יותר כמו q2_K יפגע באיכות הטקסט, בעוד גרסאות גדולות דורשות מעל 13 גיגה בייט.

איך מריצים

קובץ q4_K_M שוקל 7.87 גיגה בייט וצורך 10.37 גיגה בייט של זיכרון עבודה כדי לרוץ על המעבד לבדו. אם יש לכם כרטיס גרפי, אפשר להעביר אליו שכבות חישוב בעזרת הדגל ngl כדי להאיץ את מהירות הפליטה. הקבצים נעים בין q2_K שדורש כ־8 גיגה בייט זיכרון ועד q8_0 שתופס מעל 16 גיגה בייט ומאט מאוד את המעבד.

כדי להריץ אותו דרך llama.cpp, חובה להשתמש בגרסה מ־21 באוגוסט 2023 או מוקדם יותר, ספציפית מקומיט dadbed99e65252d79f81101a392d0d6497b86caa. ספריות כמו ctransformers או ממשק LM Studio ישן יקראו אותו בלי שרת חיצוני. אם אין לכם לפחות 16 גיגה זיכרון פנוי במחשב, או שאתם לא מוכנים להתעסק בהתקנת גרסאות עבר של תוכנות, חבל על הזמן. פשוט תעבדו מול API של שירות ענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/Llama-2-13B-chat-GGML")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ומפנה לרישיון המסחרי המותאם של מטא עבור Llama 2. הוא מחייב אישור והורדה דרך האתר הרשמי שלהם, ואוסר על שימוש לצורך אימון מודלים מתחרים או שימושים לא חוקיים. עבור מוצרים מסחריים רגילים הוא פתוח לשימוש חופשי, כל עוד אינכם עוברים את תקרת המשתמשים שהוגדרה בתנאי מטא.

הרישיון המלא בעמוד המודל ↗