GPT
L

Llama-2-70B-Chat-GGUF

קוד פתוח

TheBlokellama22023-09-04

  • transformers
  • gguf
  • llama
  • facebook
  • meta

גרסת קוונטיזציה של מודל הדגל הפתוח מבית מטא. מתאימה למי שחייב להריץ מודל שיחה חזק על שרת פרטי במקום לשלם על כל קריאת ענן.

  • 470 GBמשקל הקבצים
  • 9,756הורדות בחודש
  • 121לייקים

מה זה

החבילה הזו מכילה המרות שונות בפורמט GGUF למודל השיחה בגודל 70 מיליארד פרמטרים של מטא. מטא אימנה אותו על שני טריליון טוקנים, הוסיפה כוונון עם מעל מיליון דוגמאות אנושיות, ושילבה מנגנון Grouped-Query Attention כדי לייעל את הריצה.

במקום להחזיק משקולות מלאות שדורשות זיכרון עצום, הדחיסה מאפשרת טעינה בקבצים קטנים בהרבה. TheBloke יצר כאן מגוון רחב של רמות דיוק, החל מגרסאות 2 ביט מכווצות מאוד ועד 8 ביט, שרובן מיועדות לעבודה עם תוכנות כמו llama.cpp על מעבדים וכרטיסים גרפיים ביתיים ומקצועיים כאחד.

מתאים ל

  • בוט שירות באנגלית בארגון

    מתאים לשיחה שוטפת ומנומסת באנגלית כשיש חובה מוחלטת לשמור את המידע בתוך הרשת הפנימית.

  • פיתוח עם LangChain מקומי

    אינטגרציה חלקה מול כלי פיתוח בפייתון בלי תלות במפתחות צד שלישי ובלי לשלם לפי טוקן.

  • מחקר על יישור מודלים

    בסיס מצוין לבדיקת בטיחות והתנהגות תגובות לאחר אימון RLHF מורכב על מודל פתוח גדול.

איפה זה נופל

הכרטיס מדגיש שהמודל מיועד לאנגלית בלבד. שימוש בשפות אחרות, כולל עברית, מוגדר מפורשות מחוץ לתחום התכנון שלו. נוסף על כך, נתוני האימון נחתכו בספטמבר 2022 עם מעט עדכונים עד יולי 2023, כך שאין לו שום ידע עדכני. חלון ההקשר עומד על 4096 טוקנים בלבד, שזה מעט מאוד למסמכים ארוכים.

אותה משפחה

Llama-2 יצא ב־17 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איזה קובץ מומלץ להוריד מתוך כל הרשימה?

קובץ Q4_K_M שוקל 41.42 גיגה בייט ומספק איזון מעולה בין איכות התשובות לדרישות החומרה. מי שיש לו פחות זיכרון יכול לנסות את Q3_K_M, אבל איכות הטקסט תרד בצורה מורגשת.

איך מחברים את הקבצים הגדולים כמו Q6_K שמופיעים בחלקים?

בגלל מגבלות גודל קובץ באתר, הגרסאות האלה פוצלו לשניים. מורידים את שני החלקים ומאחדים אותם לפקודה אחת באמצעות cat בלינוקס או COPY /B בחלונות לפני הטעינה.

איך מריצים

כדי להריץ את הקובץ המומלץ Q4_K_M דרושים לפחות 43.92 גיגה בייט של זיכרון RAM או זיכרון גרפי VRAM אם פורקים את כל השכבות לכרטיס. אפשר להשתמש בספריות כמו ctransformers בפייתון, או בכלים כמו LM Studio ו־text-generation-webui.

אם אין לכם לפחות 48 גיגה בייט של VRAM מהיר, הביצועים בלוקאל יהיו איטיים מאוד בגלל צוואר הבקבוק של הזיכרון. במצב כזה, עדיף בהרבה להשתמש ב־API מנוהל של ספק ענן מאשר לקנות חומרה ייעודית.

ollama run hf.co/TheBloke/Llama-2-70B-Chat-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון מותאם של מטא המאפשר שימוש מסחרי ומחקרי. תנאי השימוש מחייבים קבלת אישור באתר מטא לפני ההורדה, ועמידה במדיניות השימוש ההוגן שלהם, כולל איסור על שימוש בשפות שאינן נתמכות.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗