GPT
M

QuantFactory/Meta-Llama-3-8B-Instruct-GGUF

קוד פתוח

QuantFactoryllama32024-04-18

  • gguf
  • facebook
  • meta
  • pytorch
  • llama

גרסת GGUF מכווצת של המודל הפופולרי מבית מטא. מתאימה למי שרוצה להריץ מודל שיחה של שמונה מיליארד פרמטרים על חומרה מקומית רגילה בלי להסתמך על שרתי ענן.

  • 67.7 GBמשקל הקבצים
  • 13,603הורדות בחודש
  • 334לייקים

מה זה

מדובר בהמרה של דגם השיחה בנפח 8B של מטא לפורמט llama.cpp. הדגם אומן על מעל 15 טריליון טוקנים ממקורות ציבוריים ועבר כוונון ייעודי להוראות ושיחה עם יותר מעשרה מיליון דוגמאות מתויגות. הוא מייצר טקסט וקוד בלבד ומציע חלון הקשר של 8k טוקנים.

במבחני ביצועים כלליים הדגם הבסיסי מציג קפיצה ברורה מול הדור הקודם, למשל ציון של 66.6 במבחן MMLU לעומת 45.7 בגרסת 7B הישנה, וציון של 78.6 במבחן ARC Challenge. המשמעות בפועל היא יכולת טובה בהרבה בהבנת הוראות מורכבות, הסקת מסקנות ופתרון בעיות, ברמה שהייתה שמורה בעבר למודלים כבדים בהרבה.

מתאים ל

  • עוזר שיחה אישי במחשב

    רץ מקומית דרך llama.cpp ומספק מענה מהיר להוראות וקוד באנגלית בלי לשלוח מידע החוצה.

  • יצירה וניתוח קוד מקומי

    המודל פולט קוד ומציג תוצאות גבוהות בבדיקות הסקת מסקנות בהשוואה לדור הקודם.

  • פיתוח שירותים פנימיים

    מאפשר הרצת משימות טקסט באנגלית על שרתים פנימיים תחת תנאי הרישיון המסחרי של מטא.

איפה זה נופל

הכרטיס מדגיש שהמודל מיועד ומכוון לשימוש באנגלית בלבד. כל שפה אחרת, כולל עברית, נמצאת מחוץ להגדרת המטרות של מטא, מה שאומר שייצור טקסט בעברית עלול לכלול טעויות דקדוק והזיות אם לא תבצעו כוונון עדין בעצמכם. בנוסף, המידע עליו התבסס האימון מוגבל בזמן ונעצר במרץ 2023, כך שהוא לא יודע כלום על אירועים שהתרחשו אחרי התאריך הזה.

אותה משפחה

Meta-Llama-3 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית ישר מהקופסה?

הכרטיס מציין במפורש שהשימוש המיועד הוא באנגלית בלבד. הוא עשוי להבין מילים בודדות, אך שימוש מחוץ לאנגלית אינו נתמך רשמית ודורש אימון או כוונון נוסף מצדכם.

מה תאריך העדכון של הידע במודל?

האימון של גרסת 8B נעצר על נתונים ממרץ 2023. הוא אינו מודע לעובדות, מוצרים או עדכוני תוכנה שיצאו אחרי המועד הזה.

איך מריצים

הקובץ מגיע בפורמט GGUF, כך שאתם מורידים קובץ בודד שמכיל את המשקולות ומריצים אותו ישירות בעזרת llama.cpp, שרתי אולמה או תוכנות מקומיות דומות. אין צורך בסביבת פייתון מורכבת או בהתקנת ספריות כבדות.

דגם בגודל כזה רץ בקלות על מעבדים מודרניים או על כרטיסי מסך ביתיים עם זיכרון צנוע, בלי לחכות בתור או לשלם על כל קריאה. אם אתם בונים שירות שצריך לעמוד בעומס של אלפי משתמשים בו זמנית, החזקת תשתית מקומית עלולה להכביד, ואז שווה לשקול פנייה לפתרון מנוהל.

ollama run hf.co/QuantFactory/Meta-Llama-3-8B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון llama3 של מטא, שמאפשר שימוש מסחרי ומחקרי בכפוף למדיניות השימוש המקובלת שלהם. תנאי השימוש מחייבים עמידה בהנחיות הבטיחות וההפצה, ובמידה ואתם מפתחים מוצר לקהל הרחב כדאי לעיין בנוסח המלא באתר של מטא.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗