GPT
L

Llama-3.2-3B-Instruct-Q4_K_M-GGUF

קוד פתוח

hugging-quantsרישיון לא דווח2024-09-25

  • gguf
  • facebook
  • meta
  • pytorch
  • llama

גרסה מכווצת במשקל של פחות משני ג'יגה בייט למודל הוראות קטן, שנועדה לרוץ מקומית על מחשב רגיל בלי שרתים ייעודיים ובלי להסתמך על רשת.

  • 1.9 GBמשקל הקבצים
  • 34,215הורדות בחודש
  • 41לייקים

מה זה

מדובר בהמרה בכימות של ארבעה ביט למודל ההוראות בן שלושה מיליארד פרמטרים של מטא, ארוזה בפורמט שמתאים ישירות להרצה עם llama.cpp. כל החבילה שוקלת 1.9 ג'יגה בייט בשלושה קבצים, מה שמאפשר להוריד אותה בדקות בודדות ולהריץ אותה ישירות מהזיכרון של לפטופ פשוט.

המטרה כאן היא יצירת טקסט ומענה להוראות במשאבים מינימליים. הוא תומך רשמית בשמונה שפות שכוללות אנגלית, גרמנית, צרפתית, איטלקית, פורטוגזית, הינדי, ספרדית ותאילנדית, אך עברית אינה מופיעה ברשימת השפות הרשמיות שלו. הדף עצמו לא מציג תוצאות מבחנים או בנצ'מרקים, אלא מתמקד בצד הטכני של ההרצה המקומית.

מתאים ל

  • עוזר מקומי על לפטופ

    משקל של 1.9 ג'יגה מאפשר להריץ מענה להוראות באנגלית ישירות מהמעבד בלי חיבור לאינטרנט.

  • מיון טקסטים בשפות נתמכות

    מתאים לסיווג ותיוג מהיר של טקסטים קצרים באנגלית, ספרדית או שפות אירופיות אחרות שנתמכות בו.

  • בדיקות ופיתוח מהיר

    הקמה זריזה של שרת מקומי עם llama-server לבדיקת תהליכי עבודה לפני פריסה לשרתים גדולים.

איפה זה נופל

החיסרון המרכזי לקורא הישראלי הוא שעברית אינה חלק משמונה השפות הנתמכות שפורסמו, ולכן לא הייתי בונה עליו לשום מוצר שדורש עברית תקנית בלי בדיקה יסודית. מעבר לזה, מדובר במודל של שלושה מיליארד פרמטרים עם כימות של ארבעה ביט בלבד, כך שיכולות ההסקה שלו מוגבלות מאוד ביחס למודלים גדולים, והכרטיס לא מספק נתוני דיוק או מדידות שמוכיחות כמה נפגעה האיכות בהמרה.

שאלות
נפוצות

האם המודל מתאים לעבודה בעברית?

רשימת השפות הרשמית כוללת אנגלית, גרמנית, צרפתית, איטלקית, פורטוגזית, הינדי, ספרדית ותאילנדית בלבד. עברית לא מצוינת שם, ובמודל מכווץ בגודל כזה היכולת לייצר פלט עברי איכותי מוטלת בספק רב.

אילו דרישות חומרה צריך כדי להרים אותו?

הקובץ שוקל 1.9 ג'יגה בייט בכימות ארבעה ביט, ולכן כמעט כל מחשב מודרני עם ארבעה ג'יגה בייט זיכרון פנוי יריץ אותו ישירות מהמעבד דרך llama.cpp, בלי שום צורך בכרטיס מסך ייעודי.

איך מריצים

אתם יכולים להריץ אותו ישירות דרך llama.cpp, שמתקינים דרך brew על מק ולינוקס, או על ידי קימפול ישיר מגיטהאב עם תמיכה בהאצת חומרה כמו CUDA אם יש לכם כרטיס מתאים. המודל מופעל בשורת פקודה אחת דרך llama-cli או כשרת מקומי עם llama-server שמקשיב לבקשות, כשהפקודות בדף מוגדרות מראש לעבוד עם חלון הקשר של 2048 טוקנים.

משקל של 1.9 ג'יגה בייט אומר שהוא יעלה בלי בעיה גם על מעבדים רגילים או מכונות חלשות עם זיכרון צנוע, בלי שום צורך בכרטיסי מסך יקרים. אם המטרה היא משימות כבדות או עיבוד כמויות עצומות של טקסט מורכב, פנייה ל־API של מודל ענק תחסוך את מגבלות הגודל והאיכות של מודל קטן.

ollama run hf.co/hugging-quants/Llama-3.2-3B-Instruct-Q4_K_M-GGUF:Q4_K_M

הקבצים

3 קבצים במאגר, 1.9 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון של הקובץ הזה לא דווח בדף המודל. אף על פי שמודל המקור שייך למטא ומופץ תחת תנאי הקהילה שלהם, היעדר רישיון מפורש בהעלאה הזו אומר שאין לכם הגדרה משפטית ברורה לשימוש מסחרי, וזה סיכון שצריך להסדיר מול תנאי המקור של מטא לפני שמשלבים אותו במוצר.

הרישיון המלא בעמוד המודל ↗