GPT
L

Llama-3.2-3B-Instruct-llamafile

קוד פתוח

mozilla-aillama3.22024-10-02

  • llamafile
  • facebook
  • meta
  • pytorch
  • llama

הפצה עצמאית בקובץ יחיד שרץ ישירות על המעבד בלי התקנת תלויות. שילוב של מודל קומפקטי שמיועד לעבודה מקומית עם מעטפת הרצה מוכנה מראש.

  • 26.1 GBמשקל הקבצים
  • 1,165הורדות בחודש
  • 52לייקים

מה זה

מטא שחררה את גרסת 3.2 שמכווצת את היכולות של המודלים הגדולים שלה לגודל של 3.21 מיליארד פרמטרים, ומוזילה ארזה אותה בפורמט llamafile. הפורמט הזה מאחד את משקלי המודל יחד עם קוד הריצה לתוך בינארי בודד, כך שאפשר להוריד קובץ אחד ולהריץ אותו ישירות דרך שורת הפקודה או כממשק רשת בלי לגעת בדרייברים או סביבות פייתון.

המשקל הנמוך הושג באמצעות זיקוק ידע מהגרסאות הגדולות של 8B ו־70B, מה שנותן לו ביצועים טובים במשימות שיחה, סיכום והפעלת כלים. במבחן IFEval למעקב אחר הוראות הוא מגיע לציון 77.4 וב־GSM8K לחשיבה מתמטית הוא רושם 77.7, שזה קרוב באופן מפתיע למודל ה־8B המקורי, אם כי בהבנת הנקרא עמוקה ומבחנים מורכבים כמו GPQA עם 32.8 דיוק רואים היטב את הפער שנשאר בגלל הגודל הפיזי.

מתאים ל

  • עוזר מקומי למפתחים

    רץ כקובץ בודד ללא שרת חיצוני ומאפשר שכתוב שאילתות וטקסטים בלי לחשוף נתונים.

  • סיכום טקסטים קצרים באופליין

    מפיק תוצאות מהירות עם צריכת זיכרון נמוכה של פחות מ־7 גיגה בייט כולל הקשר.

  • הפעלת פונקציות וכלים

    מציג דיוק של 67 אחוזים ב־BFCL ומסוגל להמיר הוראות טקסט לקריאות API מקומיות.

איפה זה נופל

הבעיה המרכזית כאן היא שפות. המודל אומן רשמית רק על שמונה שפות שאינן כוללות עברית, כך שתמיכה בעברית מחוץ לקופסה מוגבלת מאוד ואינה מובטחת בלי כוונון ייעודי. בנוסף, חלון ההקשר אמנם מוגדר עד 128 אלף טוקנים, אבל במבחני שליפה מורכבים וקריאת טקסט ארוך כמו InfiniteBench הביצועים צונחים לציון F1 של 19.8 בלבד, מה שאומר שהוא מתקשה לשמור על דיוק בניתוח מסמכים מלאים. הידע שלו נעצר בדצמבר 2023 ומטא מדגישה שהוא לא נבנה לעבוד כמערכת עצמאית ללא שכבות הגנה מסביב.

שאלות
נפוצות

האם אפשר להריץ את המודל על מחשב נייד ישן בלי כרטיס מסך?

כן, קובץ ה־Q6_K דורש כ־6.2 גיגה בייט זיכרון כולל חלון הקשר בסיסי, ורץ ישירות על המעבד. על מעבדי אינטל מודרניים הוא מפיק סביב 27 טוקנים לשנייה, קצב שמתאים לחלוטין לשיחה אישית.

האם המודל מתאים לעיבוד טקסטים בעברית?

רשמית לא. המודל אומן ותומך בשמונה שפות בלבד שרובן אירופאיות בתוספת הינדי ותאי, ולכן כתיבה או הבנה של עברית ידרשו אימון נוסף ולא יעבדו טוב ישירות מהקופסה.

איך מריצים

ההרצה פשוטה מאוד ומסתכמת בהורדת הקובץ, מתן הרשאות הרצה והפעלה שלו בטרמינל. הקובץ המומלץ הוא גרסת ה־Q6_K ששוקלת 2.76 גיגה בייט ורצה על כל מחשב מודרני עם לפחות 8 גיגה בייט זיכרון עבודה, כאשר חלון ההקשר ברירת המחדל תופס כ־3.4 גיגה בייט זיכרון נוספים. משתמשי ווינדוס חייבים להשתמש בגרסה הזו בגלל מגבלת גודל קובץ הפעלה של 4 גיגה בייט.

אם רוצים לפתוח את כל חלון ההקשר של 128 אלף טוקנים, תצטרכו לפחות 16.4 גיגה בייט של זיכרון פנוי למודל לבדו. על מעבדי אינטל או אפל מודרניים גרסת ה־Q6_K מייצרת בין 27 ל־60 טוקנים לשנייה, כך שאם אתם עובדים מקומית במכונה בודדת אין שום צורך לפנות לשרת חיצוני, אבל עבור שירות שצריך לשרת עשרות משתמשים במקביל כדאי לעבור לשרת ייעודי עם כרטיסי מסך.

pip install -U huggingface_hub
hf download mozilla-ai/Llama-3.2-3B-Instruct-llamafile

הרישיון

הרישיון הוא Llama 3.2 Community License של מטא, שמאפשר שימוש מחקרי ומסחרי חופשי כל עוד עומדים במדיניות השימוש המקובל שלהם. המגבלה המסחרית העיקרית חלה על חברות ענק עם מעל 700 מיליון משתמשים פעילים בחודש, שנדרשות לבקש רישיון מיוחד.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗