GPT
M

Meta-Llama-3-8B-Instruct-GGUF

קוד פתוח

MaziyarPanahiרישיון לא דווח2024-04-18

  • transformers
  • gguf
  • mistral
  • facebook
  • meta

גרסת GGUF מכווצת של המודל מבית מטא שנועדה לשיחה, יצירת טקסט וקוד באנגלית. מפתחים בוחרים בה כדי להריץ שיחות מקומית על מעבדים פשוטים בלי להחזיק שרת כבד.

  • 76.5 GBמשקל הקבצים
  • 162,025הורדות בחודש
  • 103לייקים

מה זה

הריפוזיטורי הזה מאגד המרות GGUF שביצע MaziyarPanahi על בסיס דגם שמונה מיליארד הפרמטרים של מטא. המטרה כאן היא לאפשר עבודה מול כלי C++ מקומיים בלי לטעון משקלים מלאים בפורמט המקורי. הדגם עבר אימון ראשוני על מעל 15 טריליון טוקנים, ובהמשך עבר כוונון ייעודי להוראות ושיחה עם דגש על צמצום סירובים שגויים לעומת הדור הקודם.

במבחני ביצועים, דגם שמונה המיליארד מציג קפיצה ברורה על פני הדור הקודם. הוא קיבל 68.4 במבחן MMLU לעומת 34.1 בגרסת שבעה מיליארד הקודמת, ורשם 62.2 בבדיקת יצירת הקוד של HumanEval לעומת 7.9 בלבד בעבר. המספרים האלה מראים שהוא מחזיק הבנה כללית וכתיבת קוד ברמה שמתחרה גם בדגמים שהיו פעם גדולים ממנו בהרבה, כל עוד מדובר באנגלית בלבד.

מתאים ל

  • עוזר שיחה מקומי באנגלית

    הוא עבר כוונון לדיאלוג ומספק תגובות עקביות בשיחה ישירה בלי לשלוח מידע לרשת.

  • השלמת קוד במכונת פיתוח

    התוצאה במדד HumanEval מראה יכולת סבירה בכתיבת פונקציות קצרות על חומרה ביתית.

  • מענה טקסטואלי סגור

    הוא מתאים לשאלות ותשובות על טקסט באנגלית שנכנס במסגרת שמונת אלפים הטוקנים שלו.

איפה זה נופל

הכרטיס מדגיש שהשימוש המיועד הוא באנגלית בלבד, וכל שפה אחרת נמצאת מחוץ לטווח שהוגדר ונבדק. מי שינסה להריץ אותו בעברית יקבל תוצאות לא יציבות ולא מבוקרות. בנוסף, בסיס הידע של הדגם נעצר במרץ 2023, כך שהוא לא יודע שום דבר על אירועים שהתרחשו מאז. חלון ההקשר עומד על 8,000 טוקנים, מגבלה שתקשה עליכם לנתח מסמכים טכניים ארוכים במיוחד או קבצי קוד ענקיים ברצף.

אותה משפחה

Meta-Llama-3 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל יודע לעבוד בעברית?

כרטיס המודל מציין במפורש שהכלי נבדק ומיועד לאנגלית בלבד, וכל שפה אחרת מוגדרת מחוץ לטווח. הוא אולי יפלוט מילים בעברית, אבל איכות התשובות והאמינות שלהן לא נבדקו ואינן מובטחות.

כמה זיכרון דרוש כדי להוריד את המודל?

התיקייה המלאה שוקלת 76.5 ג'יגהבייט, אבל אין סיבה להוריד אותה. מורידים רק קובץ בודד ברמת הכיווץ הרצויה, למשל גרסת Q2_K, שמתאימה ישירות למגבלות הזיכרון של המחשב שלכם.

למה צריך להקפיד על תבנית הפרומפט?

הדגם אומן לזהות תגיות מערכת מסוימות כדי להפריד בין תפקידי המשתמש והעוזר. אם תזינו טקסט רגיל בלי הטוקנים המיוחדים, המודל לא יבין איפה הפקודה נגמרת ויתחיל לייצר הזיות.

איך מריצים

במקום להוריד את כל 76.5 הג'יגהבייט שכוללים 19 קבצים, אתם מושכים רק את קובץ הכימוס שמתאים לזיכרון שלכם, למשל גרסת Q2_K דרך שורת הפקודה. ההרצה נעשית ישירות דרך כלי כמו llama.cpp, מה שמאפשר לעבוד גם על מעבד רגיל עם דרישות זיכרון נמוכות יחסית לגודל של שמונה מיליארד פרמטרים.

חובה להשתמש בתבנית הפרומפט המדויקת של הדגם, שכוללת טוקנים מיוחדים להפרדה בין מערכת, משתמש ותשובה, אחרת הפלט מתחרבש לחלוטין. אם המטרה שלכם היא להריץ שאילתות מזדמנות בלי לתחזק מכונות או בלי להתעסק בהגדרות תבנית ידניות, קריאה לשרת ענן שכבר חושף אותו בחיבור פשוט עדיפה על התעסקות בקבצים מקומיים.

ollama run hf.co/MaziyarPanahi/Meta-Llama-3-8B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

בעמוד המודל לא מופיע רישיון מוגדר, אך כרטיס המודל המקורי של מטא מפנה לרישיון קהילתי מסחרי משלהם. אי הבהירות הזו מחייבת בדיקה זהירה לפני שילוב במוצר מסחרי, משום שאין כאן הצהרת רישוי רשמית ומחייבת של מעלה הקבצים.

הרישיון המלא בעמוד המודל ↗