GPT
L

Llama-2-7b-chat-mlx

קוד פתוח

mlx-communityllama22023-12-06

  • mlx
  • llama
  • facebook
  • meta
  • llama-2

גרסה מותאמת של מודל השיחה מבית מטא שנבנתה לעבודה ישירה על מעבדי אפל סיליקון. היא פותרת את בעיית התאימות של הפורמט המקורי בלי צורך בהגדרות מסובכות.

  • 12.6 GBמשקל הקבצים
  • 2,777הורדות בחודש
  • 85לייקים

מה זה

הפרויקט הזה לוקח את מודל השיחה הפופולרי של מטא עם שבעה מיליארד פרמטרים וממיר אותו לשימוש בספריית MLX. המטרה כאן היא לאמן או להריץ הסקת מסקנות מקומית על חומרת אפל, בצורה שמנצלת את הזיכרון המאוחד של המחשב בלי שכבות תיווך כבדות.

ההבדל הטכני המרכזי מול הגרסה המקורית נובע מהמרת המשקלים מפורמט bfloat16 לפורמט float16. הסיבה לכך היא שספריית numpy לא תומכת בפורמט המקורי ישר מהקופסה, וההמרה לקבצי npz פותרת את החיכוך הזה ומאפשרת למודל להיטען בצורה חלקה בסביבת העבודה של אפל.

בגודל כזה, מדובר במודל שמיועד בעיקר לשיחות, ניסוח טקסטים ומשימות יצירת תוכן קלות. הוא לא מביא יכולות חדשות שלא היו קיימות בגרסת הבסיס של מטא, אלא מתמקד כולו בנגישות ובהרצה מקומית על מקבוקים ומחשבי מק תואמים.

מתאים ל

  • בוט שיחה מקומי במק

    מאפשר שיחה מותאמת אישית ישירות מהחומרה של אפל בלי לשלוח שום מידע לענן חיצוני.

  • ניסוח ועריכת טקסטים

    מתאים לשכתוב, סיכום והפקת טיוטות באנגלית במחשב פיתוח אישי ללא עלויות תשתית.

  • פיתוח עם ספריית MLX

    משמש בסיס מוכן למפתחים שרוצים לבחון את יכולות הסקת המסקנות של אפל סיליקון בסביבת פייתון.

איפה זה נופל

הקובץ לא עבר כימות נוסף, ולכן 12.6 גיגה בייט הם עומס לא מבוטל על מכונות מק בסיסיות עם זיכרון נמוך. מעבר לכך, המודל הזה מוגבל לשפה האנגלית בעיקר, והוא מגיע מראש בלי התאמות מיוחדות לעברית, כך שתשובות בעברית עלולות לצאת עילגות או שבורות לגמרי. בנוסף, מודלים בגודל שבעה מיליארד פרמטרים נוטים להזיות בעובדות מורכבות.

שאלות
נפוצות

האם המודל הזה יעבוד על מחשב עם מעבד אינטל או כרטיס אנבידיה?

לא, הגרסה הזו נבנתה במיוחד עבור ספריית MLX של אפל ועובדת רק על מחשבי מק עם מעבדי אפל סיליקון. למערכות אחרות עדיף להוריד את המשקלים המקוריים של מטא או גרסאות מותאמות אחרות.

למה המשקלים הומרו לפורמט float16?

ההמרה בוצעה מכיוון שספריית numpy אינה תומכת בפורמט bfloat16 המקורי בצורה מובנית. השינוי לפורמט float16 ולסיומת npz מאפשר טעינה נקייה וללא שגיאות בסביבת העבודה של אפל.

איך מריצים

כדי להריץ אותו צריך להתקין את ספריית mlx ואת מאגר הדוגמאות שלה, להוריד את שבעת הקבצים ששוקלים יחד 12.6 גיגה בייט, ולהריץ סקריפט פייתון עם קובץ הטוקנייזר. בגלל המשקל והדיוק בפורמט float16, תצטרכו מחשב מק עם לפחות 16 גיגה בייט זיכרון מאוחד כדי שלא להיחנק משימוש מוגזם בדיסק.

אם אין לכם חומרת אפל סיליקון עדכנית, אין שום טעם לגעת בגרסה הזו. במקרה שאתם עובדים על שרתי לינוקס, חומרת אנבידיה או שאתם צריכים רק מענה מהיר בתוך אפליקציה בלי לנהל זיכרון מקומי, עדיף להשתמש בנקודת קצה של ספק ענן חיצוני.

pip install -U huggingface_hub
hf download mlx-community/Llama-2-7b-chat-mlx

הקבצים

7 קבצים במאגר, 12.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

השימוש כפוף לרישיון llama2 המקורי של מטא. מותר להשתמש בו לצרכים מסחריים ופרטיים, אך יש לעמוד במגבלות השימוש המקובלות ובמדיניות של מטא, כולל תנאים מיוחדים לחברות עם מאות מיליוני משתמשים פעילים.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗