GPT
L

Llama-3.2-3B-Instruct-4bit

קוד פתוח

mlx-communityllama3.22024-09-25

  • transformers
  • safetensors
  • llama
  • text-generation
  • facebook

גרסה מכווצת לריצה מקומית על מחשבי אפל, ששוקלת פחות משני ג'יגה. היא מתאימה למי שרוצה מודל שיחה זריז בלי לשלם על שרת ייעודי או להוציא שקל על ענן.

  • 3.2Bפרמטרים
  • 131,072טוקנים בהקשר
  • 1.7 GBמשקל הקבצים
  • 20,204הורדות בחודש

מה זה

מדובר בהמרה של גרסת ההוראות של מטא לפורמט MLX, שמתאים ישירות למעבדי אפל סיליקון. המודל עבר כימות לארבע ביט, מה שמוריד את דרישות הזיכרון ומאפשר לו לפעול ישירות על מחשב נייד בלי לחנוק את המערכת. הוא מיועד ליצירת טקסט ולשיחות, עם מבנה פנימי של 28 שכבות וארכיטקטורה מוכרת של לאמה.

היתרון המרכזי כאן הוא חלון הקשר עצום של 131,072 טוקנים, נתון חריג מאוד למודל במשקל נוצה כזה. לצד זה, רשימת השפות הנתמכות כוללת שמונה שפות כמו אנגלית, גרמנית, ספרדית ותאילנדית, אך לא כוללת עברית. המשמעות היא שבעברית הוא כנראה יתקשה מאוד להפיק פלט איכותי או יתרגם בצורה עילגת.

מתאים ל

  • סוכן מקומי במק

    שילוב בתוך אפליקציית דסקטופ שרצה מקומית על מחשבי אפל בלי לשלוח מידע לרשת.

  • עיבוד טקסט באנגלית

    סיכום מהיר וניסוח מחדש של פסקאות באנגלית ישירות בטרמינל או בסקריפט פייתון.

  • פיתוח ובדיקות אופליין

    בדיקת ממשקי צ'אט ובניית אבטיפוס על המחשב הנייד בלי תלות בחיבור לרשת או תשלום על טוקנים.

איפה זה נופל

הבעיה הבולטת ביותר לישראלים היא היעדר תמיכה רשמית בעברית. השפות המוגדרות הן אנגלית, הינדי, תאילנדית וכמה שפות אירופאיות. בנוסף, כימות של ארבע ביט על מודל קטן של שלושה מיליארד פרמטרים גובה מחיר בהיגיון וביכולת לעקוב אחרי הוראות מסובכות. חלון ההקשר אמנם ענק, אבל מודל בגודל כזה נוטה לאבד פרטים בתוך טקסטים ארוכים, כך שלא כדאי לבנות עליו לניתוח מסמכים מורכבים.

שאלות
נפוצות

האם אפשר להריץ את המודל הזה על מחשב עם כרטיס מסך של אנבידיה?

לא ישירות. הקבצים האלה עברו התאמה מיוחדת לספריית MLX שעובדת רק על החומרה של אפל. לכרטיסי אנבידיה צריך להוריד את הגרסה הרגילה בפורמט שתומך בטרנספורמרס או בפורמטים אחרים.

האם הוא יעבוד טוב עם טקסטים בעברית?

הסיכוי נמוך מאוד. עברית אינה מופיעה ברשימת השפות הנתמכות שלו, ובמודלים קטנים של שלושה מיליארד פרמטרים כמעט ואין יכולת הכללה לשפות שלא נכללו באימון המרכזי.

איך מריצים

כדי להריץ אותו מתקינים את ספריית mlx-lm בפייתון, טוענים את המשקלים ישירות עם הפקודה load, ומריצים פקודת יצירה רגילה. הקבצים כולם שוקלים 1.7 גיגה בייט, כך שכל מק עם מעבד מסדרת M וזיכרון בסיסי של 8 גיגה בייט יריץ אותו בלי להזיע.

אם אתם לא על מחשב מק, אין לכם מה לעשות עם החבילה הזו, ועדיף להשתמש בגרסת המקור דרך שרתי לינוקס או פשוט לקרוא ל־API חיצוני. שירות ענן מתאים יותר גם אם אתם צריכים לשרת עשרות משתמשים במקביל, כי הריצה המקומית הזו מיועדת בעיקר לעבודה אישית ולפיתוח.

from transformers import pipeline

pipe = pipeline("text-generation", model="mlx-community/Llama-3.2-3B-Instruct-4bit")
print(pipe("שלום"))

הרישיון

הרישיון הוא רישיון לאמה 3.2 של מטא. הוא מאפשר שימוש מסחרי ומחקר, אך כפוף למדיניות השימוש המקובל וההגבלות של מטא, כולל מגבלת משתמשים חודשיים בהיקף ענק. לפני שילוב שלו במוצר מסחרי, חובה לקרוא את התנאים הספציפיים שהוצמדו להפצה המקורית.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗