GPT
M

Meta-Llama-3-8B-Instruct-4bit

קוד פתוח

mlx-communityother2024-04-18

  • mlx
  • safetensors
  • llama
  • facebook
  • meta

גרסה מכווצת של מודל ההוראות של מטא, מותאמת ישירות לחומרת אפל סיליקון. הוא שוקל פחות מחמישה גיגה ומיועד להרצה מקומית חלקה בלי כרטיס גרפי של אנבידיה.

  • 8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 4.9 GBמשקל הקבצים
  • 3,880הורדות בחודש

מה זה

המודל הזה לוקח את מודל ההוראות של מטא עם שמונה מיליארד פרמטרים ומכווץ אותו לדיוק של 4 ביט בפורמט MLX. ההמרה נעשתה עם גרסה 0.9.0 של ספריית mlx-lm, והמטרה כאן היא לאפשר שימוש במודל שיחה ומענה להוראות ישירות על מחשבי מק, בלי להתעסק עם ספריות המרה מסורבלות.

עם הקשר של 8,192 טוקנים וארכיטקטורה של 32 שכבות, הוא מתאים למשימות גנרציה של טקסט באנגלית כמו ניתוח מסמכים קצרים, כתיבת קוד או שיחה מונחית. ההבדל בינו לבין המקור הוא בעיקר ביצועי זיכרון על מעבדי אפל, כשמגבלת השפה שלו נשארת מוגדרת רשמית לאנגלית בלבד.

מתאים ל

  • עוזר פיתוח מקומי במק

    רץ ישירות על מעבדי אפל ללא צורך בענן ושומר על פרטיות הקוד שלכם.

  • מענה להוראות באנגלית

    מתאים לשליפה ותמצות טקסטים עד גודל של שמונת אלפים טוקנים.

  • בדיקות ופיתוח מהיר

    משקל של 4.9 גיגה מאפשר להוריד ולהתחיל לפתח איתו תוך דקות ספורות.

איפה זה נופל

הכרטיס מצהיר על אנגלית בלבד, כך שלא כדאי לבנות עליו לעיבוד עברית איכותי בלי לבדוק אותו קודם בצורה יסודית. מעבר לזה, הכרטיס דל מאוד בפרטים ומפנה למודל המקורי, בלי לפרט איזה פשרות בדיוק נעשו באיכות הפלט עקב הכיווץ ל־4 ביט, כך שתצטרכו למדוד בעצמכם דיוק והזיות במשימות מורכבות.

שאלות
נפוצות

אפשר להריץ את המודל הזה על שרת לינוקס עם כרטיס של אנבידיה?

לא. המודל נבנה במיוחד עבור ספריית MLX שעובדת רק על מערכות מק עם מעבדי אפל סיליקון. ללינוקס או חלונות תצטרכו לחפש המרות אחרות כמו GGUF או את המקור.

האם הכיווץ ל־4 ביט פוגע ביכולות של המודל?

כיווץ כזה חוסך המון זיכרון אבל עלול לפגוע בעדינות של התשובות ובמשימות היגיון מורכבות. המפרסם לא צירף ציוני מבחן על ההמרה הזו, לכן מומלץ לבחון את המשימה הספציפית שלכם מול התוצאות.

איך מריצים

כדי להריץ אותו מתקינים את ספריית mlx-lm בפייתון וטוענים את המודל דרך הפונקציה המובנית. הוא דורש מחשב מק מבוסס אפל סיליקון, ובזכות הכיווץ ל־4.9 גיגה בייט הוא ירוץ בקלות גם על מכשירים עם שמונה או שישה עשר גיגה זיכרון משותף.

אם אתם לא עובדים על מק, אין לכם מה לעשות עם הקבצים האלה. במקרה כזה, או אם אתם צריכים לשרת אלפי משתמשים בו־זמנית, עדיף להשתמש ב־API מנוהל של מודל המקור במקום להחזיק חומרה מקומית.

pip install -U huggingface_hub
hf download mlx-community/Meta-Llama-3-8B-Instruct-4bit

הרישיון

הרישיון מוגדר כמשטר רישוי נפרד של מטא ולא כקוד פתוח רגיל. זה אומר שיש תנאי שימוש ייעודיים של משפחת לאמה שחייבים לקרוא לפני שמפיצים אותו במוצר מסחרי.

הרישיון המלא בעמוד המודל ↗