GPT
L

Llama-2-7B-Chat-GGML

קוד פתוח

TheBlokeother2023-07-18

  • transformers
  • llama
  • facebook
  • meta
  • pytorch

גרסה מכווצת של מודל השיחה מבית מטא שמתאימה להרצה מקומית על מעבד. מיועדת למי שחייב לעבוד עם תשתיות ישנות שתומכות בפורמט הקודם.

  • 56.3 GBמשקל הקבצים
  • 298הורדות בחודש
  • 873לייקים

מה זה

מדובר במודל שיחה מכוונן עם שבעה מיליארד פרמטרים, שעבר אופטימיזציה לדיאלוג באמצעות למידה מונחית ומשוב אנושי. המאגר מכיל קבצים מכווצים בפורמט GGML הישן, שנועדו לאפשר ריצה מהירה על מעבדי מחשב אישיים או שילוב חלקי עם כרטיסי מסך, בלי צורך בשרתים ייעודיים ענקיים.

במבחני ביצועים אקדמיים המודל הציג שיפור לעומת הדור הראשון, עם 45.3 במבחן MMLU ודיוק של 14.6 במתמטיקה. במדדי בטיחות הוא הגיע לציון אפס במדד הרעילות של טוקסיגן, מה שמראה על סינון מחמיר במיוחד של תוכן שעלול להיחשב בעייתי.

מתאים ל

  • עוזר שיחה מקומי באנגלית

    צ'אט שרץ מקומית על מחשב נייד רגיל בלי לשלוח מידע החוצה, בזכות כיבוץ ל־4 ביט.

  • תמיכה במערכות GGML ישנות

    שילוב בפרויקטים או ספריות פנימיות שטרם עודכנו לתמיכה בתקן GGUF החדש.

  • סינון תוכן ומענה בטוח

    מערכות שדורשות היצמדות מחמירה לבטיחות, בהתאם לציון האפס שקיבל במבחני רעילות.

איפה זה נופל

הפורמט של הקבצים האלה הוחלף רשמית ולא נתמך בספריות מודרניות. מעבר לזה, הביצועים שלו בכתיבת קוד חלשים מאוד ועומדים על 16.8 בלבד במבחני הערכה. המודל אומן ונבדק באנגלית בלבד, כך ששימוש בעברית או בכל שפה אחרת מוגדר על ידי מטא כחריגה מייעוד הכלי ויוביל לשגיאות תרגום והזיות.

שאלות
נפוצות

למה לא להוריד את הגרסה הזו לפרויקט חדש?

הפורמט הזה כבר אינו נתמך בספריות העדכניות של llama.cpp מאז אוגוסט 2023. לפרויקט חדש עדיף לקחת את קובצי ה־GGUF המעודכנים של אותו מודל, אחרת תיתקלו בשגיאות טעינה.

האם המודל מתאים לעבודה בעברית?

הכרטיס מציין במפורש שהמודל מיועד לאנגלית בלבד, וכל שפה אחרת נמצאת מחוץ לטווח השימוש שהוגדר. הוא לא עבר התאמה לעברית וייטה להמציא עובדות או לייצר תחביר שגוי.

איך מריצים

המודל מחולק לכמה דרגות כיבוץ, מגרסאות 2 ביט ששוקלות 2.87 גיגה בייט ודורשות 5.37 גיגה בייט זיכרון, ועד גרסת 8 ביט ששוקלת 7.16 גיגה בייט ודורשת קרוב לעשרה גיגה בייט זיכרון. לרוב המשתמשים קובץ כמו q4_K_M במשקל 4.08 גיגה בייט ייתן איזון סביר בין מהירות לאיכות, וירוץ על מחשב עם שמונה גיגה בייט זיכרון עבודה.

כדי להריץ אותו בפועל צריך גרסה ישנה של llama.cpp מלפני 21 באוגוסט 2023, או ממשקים כמו LM Studio וטקסט ג'נריישן ווב יו איי. אם התוכנה שלכם מעודכנת, עדיף להוריד ישירות את גרסאות ה־GGUF המודרניות יותר מאותו יוצר.

from transformers import pipeline

pipe = pipeline("text-generation", model="TheBloke/Llama-2-7B-Chat-GGML")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כאחר ומפנה לרישיון המסחרי המותאם של מטא. הוא מאפשר שימוש מחקרי ומסחרי, אבל דורש בקשת גישה ואישור התנאים ישירות באתר של מטא לפני השימוש בתוצרים.

הרישיון המלא בעמוד המודל ↗