GPT
L

bartowski/Llama-3.2-3B-Instruct-GGUF

קוד פתוח

bartowskillama3.22024-09-25

  • gguf
  • facebook
  • meta
  • llama
  • llama-3

גרסת קוונטיזציה מכווצת של מודל ההוראות הקטן של מטא, שרצה ישירות על מעבדי מכשירים אישיים. פתרון ממוקד למי שחייב ביצועים מקומיים בזיכרון עבודה מינימלי.

  • 40.2 GBמשקל הקבצים
  • 108,854הורדות בחודש
  • 231לייקים

מה זה

מדובר בהמרה לפורמט GGUF של המודל Llama-3.2-3B-Instruct, שבוצעה באמצעות גרסה b3821 של llama.cpp על ידי המפתח bartowski. המטרה כאן היא לאפשר הרצה על מעבדים פשוטים וכרטיסי מסך צרכניים דרך כלים כמו LM Studio. השימוש בטכניקת imatrix נועד לשמר כמה שיותר מהיכולות המקוריות של המודל גם בגרסאות הדחוסות ביותר.

המשקלים הזמינים נעים בין קובץ f16 מלא בנפח 6.43 גיגה בייט לבין קבצים מכווצים במיוחד שיורדים עד 1.6 גיגה בייט בפורמט IQ3_M. המודל מכוון למשימות ייצור טקסט ומענה להוראות, וכולל אופטימיזציות ייעודיות לארכיטקטורות ARM שמאיצות את קצב העבודה על שבבים תואמים.

מתאים ל

  • סיווג טקסט מקומי

    שוקל כשני גיגה בייט בלבד ומאפשר מיון פניות או ניתוח טקסט ישירות על חומרת הקצה ללא הוצאות ענן.

  • עוזר פנימי באופליין

    רץ ישירות על מעבדי ARM ומחשבים אישיים ללא צורך בחיבור לרשת או חשיפת מידע רגיש החוצה.

  • ניסוח תשובות קצרות

    מגיב מהר להוראות מוגדרות מראש שאינן דורשות הסקה לוגית כבדה או בסיס ידע עמוק.

איפה זה נופל

מודל בגודל שלושה מיליארד פרמטרים מוגבל מראש ביכולת ההסקה וההבנה שלו ביחס למודלים הסטנדרטיים בשוק. תאריך הידע שלו נעצר בדצמבר 2023, והוא עלול לייצר שגיאות עובדתיות במשימות מורכבות. בנוסף, רשימת השפות הרשמית שלו כוללת שמונה שפות בלבד, ביניהן אנגלית, ספרדית ותאילנדית, ועברית אינה מופיעה בהן. ניסיון להפעיל אותו בעברית ידרוש בדיקה יסודית כדי לראות אם התוצר בכלל שמיש.

אותה משפחה

Llama-3.2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ בדיוק כדאי לי להוריד מתוך הרשימה?

אם אתם לא רוצים להסתבך, קחו את Q4_K_M ששוקל 2.02 גיגה בייט ומאזן היטב בין גודל לאיכות. אם יש לכם מספיק זיכרון בכרטיס המסך ואתם רוצים דיוק מקסימלי, עברו לגרסת Q6_K_L שתופסת 2.74 גיגה בייט.

האם המודל ירוץ טוב בעברית?

החומר הרשמי של המודל מציין תמיכה בשמונה שפות בלבד, ועברית אינה אחת מהן. הוא עשוי לפלוט מילים בעברית אך ברמת דיוק נמוכה, ולכן למשימות בעברית כדאי לבדוק אותו מקומית לפני שמסתמכים עליו.

האם קובצי ה־ARM מיועדים למחשבי מק עם מעבדי אפל?

לא. הקבצים בעלי הסיומת Q4_0_X_X נבנו במיוחד לשבבי ARM ייעודיים ואינם מיועדים להרצה דרך Metal במחשבי מק. למשתמשי מק עדיף לבחור בגרסאות ה־K הסטנדרטיות.

איך מריצים

אתם מורידים קובץ בודד בלבד לפי כמות הזיכרון הפנויה אצלכם. קובץ הדיפולט המומלץ לרוב המשתמשים הוא Q4_K_M ששוקל 2.02 גיגה בייט, ודורש כרטיס מסך בסיסי עם לפחות 3 עד 4 גיגה בייט זיכרון כדי להחזיק את המודל ואת ההקשר במלואם. אם אתם עובדים על חומרת ARM ישירה, קיימים קבצים ייעודיים כמו Q4_0_4_4 שנותנים קפיצת מהירות, אך אינם מתאימים לשימוש עם Apple Metal.

הרצה מקומית משתלמת כשאתם צריכים פרטיות מלאה, עבודה ללא רשת או אפס עלויות פר קריאה. אם אתם צריכים לוגיקה עמוקה, עיבוד מסמכים ארוכים ומורכבים או תשובות באיכות גבוהה בלי לנהל משאבים במכשיר הקצה, עדיף להישאר עם API מרוחק של מודל גדול בהרבה.

ollama run hf.co/bartowski/Llama-3.2-3B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר תחת תנאי llama3.2 של מטא. הוא מאפשר שימוש מסחרי ומחקרי בכפוף להגבלות השימוש המקובלות של החברה, כל עוד היקף המשתמשים החודשי אינו חורג מהרף המוגדר בהסכם של מטא. אם אתם משלבים אותו במוצר, אתם מחויבים לעמוד בתנאי המדיניות הללו.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗