GPT
L

Llama-2-7B-GGML

קוד פתוח

TheBlokellama22023-07-18

  • transformers
  • llama
  • facebook
  • meta
  • pytorch

גרסת קבצים מכווצת של מודל הבסיס מלאמה שמתאימה להרצה ישירה על מעבדים ביתיים. היא נועדה למי שמחזיק תשתית ישנה שתלויה בפורמט הקודם של llama.cpp.

  • 56.3 GBמשקל הקבצים
  • 145הורדות בחודש
  • 219לייקים

מה זה

מדובר במודל הבסיס של מטא בגודל שבעה מיליארד פרמטרים שעבר המרה וכימוס בידי TheBloke. הדגם הזה אינו גרסת צ'אט שעברה התאמה להוראות, אלא מודל גנרטיבי שמשלים טקסט על בסיס שני טריליון טוקנים שעליהם אומן. חלון ההקשר עומד על 4,096 טוקנים, ללא שימוש בארכיטקטורת תשומת לב מקובצת שקיימת רק בדגם הגדול יותר.

במבחני ביצועים אקדמיים המודל מציג שיפור לעומת הדור הראשון, עם ציון 45.3 במבחן MMLU לעומת 35.1, וציון של 16.8 במבחני קוד. המספרים האלה מראים יכולת סבירה להבנת הנקרא ושפה, אבל ביצועים חלשים מאוד בתכנות ובמתמטיקה, שבה קיבל רק 14.6 נקודות. במדד האמינות הוא הגיע לציון 33.29 בלבד, כך שהוא נוטה להמציא עובדות בביטחון מלא כשהוא מתבקש לענות על שאלות ידע.

מתאים ל

  • השלמת טקסט באנגלית

    מתאים לסגירת משפטים ויצירת פסקאות רציפות במערכות ישנות שעדיין קוראות קובצי בינארי בפורמט GGML ישירות מהדיסק.

  • אימון מקומי מקדים

    משמש כבסיס יציב של 7 מיליארד פרמטרים שממנו אפשר להתחיל כוונון עדין למשימות ספציפיות על חומרה ביתית.

  • ניסויי כימוס על מעבד

    מספק מגוון רחב של שיטות חיתוך סיביות כדי לבדוק ירידת דיוק מול שימוש בזיכרון במחשבים ללא כרטיס מסך.

איפה זה נופל

הקוד בכרטיס המודל מוגדר עבור השפה האנגלית בלבד, ושימוש בשפות אחרות מוגדר מפורשות כחריגה מהייעוד שלו. ללא תהליך כוונון ייעודי, הוא לא יפיק עברית שמישה. בנוסף, זהו מודל בסיס ללא תבנית הנחיות מובנית, ולכן אי אפשר לנהל איתו שיחה רגילה בלי להנדס עבורו טקסט המשך. במבחני בטיחות מול הדור הקודם, רמת הרעילות של התוכן עמדה על 21.25 אחוזים, נתון שמחייב סינון פלט קפדני לפני שחושפים אותו למשתמשים.

שאלות
נפוצות

למה כדאי להוריד את הקבצים האלה במקום את גרסת GGUF?

אין שום סיבה טכנית לעשות את זה עבור פרויקט חדש. ההרצה כאן מתאימה רק למי שמחזיק מוצר ישן או סביבת ייצור שלא שודרגה מאז אוגוסט 2023 ותלויה בגרסאות קודמות של llama.cpp.

האם אפשר להשתמש במודל הזה כמו ב־ChatGPT?

לא ישירות. זהו מודל השלמת טקסט ולא מודל שיחה, ולכן הוא ימשיך את המשפט שתכתבו במקום לענות עליו. כדי לקבל עוזר אישי צריך להשתמש בגרסת Chat או להגדיר תבניות טקסט מורכבות.

כמה זיכרון מחשב צריך בשביל להריץ אותו בצורה שמישה?

עבור הגרסה המאוזנת ביותר, q4_K_M, תצטרכו לפחות 6.58 גיגה בייט של זיכרון עבודה חופשי במערכת. אם אתם מעבירים את החישובים לכרטיס מסך, נפח הזיכרון הגרפי הנדרש יורד בהתאם למספר השכבות שהעברתם.

איך מריצים

הפורמט בעמוד הזה מיושן לחלוטין. פרויקט llama.cpp הפסיק לתמוך בקובצי GGML באוגוסט 2023 לטובת תקן GGUF, ולכן המודל יעבוד רק אם נשארתם על קוד מקור ישן מקומיט מסוים, או בכלים כמו LM Studio וספריות פייתון שעדיין שומרות תאימות לאחור.

המשקלים נעים בין קובץ של 2.87 גיגה בייט בכימוס של שתי סיביות ועד 7.16 גיגה בייט בכימוס של שמונה סיביות. גרסת q4_K_M שוקלת 4.08 גיגה בייט ודורשת לפחות 6.58 גיגה בייט זיכרון עבודה בהרצה על מעבד בלבד. אם יש לכם כרטיס מסך, פריקה של 32 שכבות אליו תוריד את העומס מזיכרון המערכת.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/Llama-2-7B-GGML")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון מסחרי מותאם אישית של מטא. הוא מאפשר שימוש חופשי למחקר ולמוצרים מסחריים, אך מחייב אישור מראש באתר החברה בעת הורדת המשקלים ומגביל את השימוש להנחיות המדיניות שלהם, כולל איסור על שימוש מחוץ לשפה האנגלית.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗