GPT
L

lmstudio-community/Llama-3.2-3B-Instruct-GGUF

קוד פתוח

lmstudio-communityllama3.22024-09-25

  • transformers
  • gguf
  • facebook
  • meta
  • pytorch

גרסת GGUF מכווצת למודל הקטן של מטא, שמיועדת לשיחה וסוכנים מקומיים. היא מתאימה למי שחייב חלון הקשר של 128K בלי להחזיק שרת יקר.

  • 9.2 GBמשקל הקבצים
  • 92,557הורדות בחודש
  • 47לייקים

מה זה

מטא בנתה את הדגם הזה מראש לתרחישי שיחה רב לשוניים, סיכום טקסטים ומשימות אחזור שמפעילות סוכנים. ההתאמה לפורמט GGUF מאפשרת לטעון אותו ישירות לתוך כלי הרצה מקומיים כמו LM Studio או llama.cpp, בלי להתעסק בהגדרות סביבה כבדות של פייתון.

היתרון המרכזי בגודל של שלושה מיליארד פרמטרים הוא התמיכה המובנית בחלון הקשר ארוך במיוחד שמגיע עד 128K טוקנים. זה שילוב שמאפשר לזרוק פנימה מסמכים ארוכים יחסית בלי לחנוק את החומרה, אם כי לא פורסמו כאן מבחני ביצועים שמראים כמה איכות הפלט נשמרת בקצוות הזיכרון הזה.

מתאים ל

  • סיכום מסמכים באנגלית

    חלון הקשר של 128K מאפשר לקרוא טקסטים ארוכים בלי לקרוע את המעבד.

  • סוכן מקומי פשוט

    המודל אומן לאחזור מידע ומתאים לפעולות אוטומטיות קלות על מחשב אישי.

  • צ'אטבוט רב לשוני מקומי

    תמיכה מובנית בשפות אירופיות והינדי ישירות מתוך המחשב ללא רשת.

איפה זה נופל

השפה העברית בכלל לא מופיעה ברשימת השפות הנתמכות רשמית, שכוללת רק אנגלית, גרמנית, צרפתית, איטלקית, פורטוגזית, הינדי, ספרדית ותאי. למרות שהוא אומן על שפות נוספות, בעברית הוא צפוי לגמגם, להזות או לייצר שגיאות תחביר.

בנוסף, מודל של שלושה מיליארד פרמטרים עדיין מוגבל מאוד ביכולת ההיגיון שלו. משימות חשיבה מורכבות או שלבים לוגיים מסובכים בסוכנים עלולים להישבר מהר מאוד בהשוואה למודלים הגדולים.

אותה משפחה

Llama-3.2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין עברית?

עברית אינה מופיעה ברשימת השפות הנתמכות רשמית על ידי מטא בדגם הזה. הוא אומן על שפות נוספות מעבר לרשימה, אבל התוצאות בעברית יהיו מוגבלות מאוד וכדאי לבדוק אותן ידנית לפני כל שימוש.

למה יש שישה קבצים במשקל 9.2 גיגה בייט?

המאגר כולל מספר קבצי GGUF ברמות כיול שונות שנוצרו על ידי bartowski. אתם לא מורידים את כולם יחד, אלא בוחרים קובץ בודד שמתאים לאיזון שאתם רוצים בין צריכת זיכרון ומהירות לבין איכות הפלט.

איך מריצים

המשקל הכולל של הקבצים עומד על 9.2 גיגה בייט ומחולק לשישה קבצים שונים, מה שאומר שאפשר להריץ אותו בקלות על מעבד רגיל ומחשב נייד עם שמונה או שישה עשר גיגה זיכרון פנימי, בלי כרטיס מסך ייעודי.

אם אתם צריכים רק שאילתות בודדות פעם ביום, לקרוא ל־API חיצוני ייקח פחות התעסקות. מריצים מקומית כשחייבים פרטיות מוחלטת של המידע, כשאין חיבור רשת רציף, או כשרצים ברקע אלפי תהליכים קטנים שחבל לשלם עליהם לפי טוקן.

ollama run hf.co/lmstudio-community/Llama-3.2-3B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון llama3.2 של מטא. הוא מאפשר שימוש מסחרי ומחקר, אבל כולל תנאי שימוש והגבלות של מטא, במיוחד לחברות ענק עם מאות מיליוני משתמשים חודשיים. כדאי לקרוא את נוסח הרישיון המקורי לפני שמפיצים אותו בתוך מוצר מסחרי רחב.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗