GPT
L

Llama-3.2-3B-Instruct-Q8_0-GGUF

קוד פתוח

hugging-quantsרישיון לא דווח2024-09-25

  • gguf
  • facebook
  • meta
  • pytorch
  • llama

גרסת קוונטיזציה של שמונה ביט למודל קומפקטי של מטא, שרצה ישירות על מעבדים ביתיים. היא נועדה למי שרוצה ביצועים קרובים למקור בלי לתפוס נפח זיכרון מוגזם.

  • 3.2 GBמשקל הקבצים
  • 1,172הורדות בחודש
  • 53לייקים

מה זה

הקובץ הזה הוא המרה ישירה של Llama-3.2-3B-Instruct לפורמט GGUF בעזרת llama.cpp. עם משקל של 3.2 גיגה בייט, המטרה כאן היא לתת מענה מקומי למשימות טקסט שונות בשמונה שפות, כולל אנגלית, גרמנית, צרפתית, ספרדית, איטלקית, פורטוגזית, הינדי ותאי.

ברמת דיוק של שמונה ביט, המודל שומר על כמעט כל היכולות של מודל המקור בהשוואה לקוונטיזציות אגרסיביות יותר, בלי לאבד עקביות בתשובות. אין כאן שינוי בארכיטקטורה אלא התאמה טכנית שמאפשרת להריץ הוראות טקסט מורכבות על חומרה רגילה בלי צורך בהתקנות כבדות של פייתון.

מתאים ל

  • בוט מקומי על מחשב נייד

    משקל של 3.2 גיגה בייט מאפשר להרים סוכן טקסט מהיר בתוך תוכנת llama.cpp בלי שרת חיצוני.

  • תרגום וניתוח שפות נתמכות

    תמיכה מובנית בשפות כמו ספרדית, גרמנית ותאי מאפשרת עיבוד טקסט אופליין ביעילות גבוהה.

  • שרת פנימי זול לבדיקות

    הקמה זריזה עם llama-server וחלון הקשר של 2048 טוקנים לבדיקת פרומפטים ישירות בטרמינל.

איפה זה נופל

החיסרון המרכזי לקורא הישראלי הוא השפות. עברית לא מופיעה ברשימת השפות הנתמכות של המודל, ולכן לא הייתי בונה עליו לשום עיבוד טקסט בעברית בלי לבדוק הזיות ותרגום עקום. בנוסף, מודל של שלושה מיליארד פרמטרים עדיין מוגבל בהבנה לוגית עמוקה או בביצוע משימות קוד מורכבות, והוא עלול לפספס עובדות בקלות רבה יותר מאחיו הגדולים.

שאלות
נפוצות

האם אפשר לעבוד איתו בעברית?

הכרטיס מפרט שמונה שפות נתמכות בלבד, ועברית אינה אחת מהן. הוא אולי יצליח להבין מילים בודדות, אבל הוא לא מיועד לכך וצפוי לטעות לעיתים קרובות.

כמה זיכרון עבודה צריך בפועל בשביל להריץ אותו?

הקובץ שוקל 3.2 גיגה בייט, כך שצריך לפחות ארבעה עד חמישה גיגה בייט של זיכרון פנוי במחשב כדי להריץ אותו יחד עם חלון ההקשר. כל מחשב מודרני עם שמונה גיגה בייט RAM יתמודד איתו בלי קושי.

איך מריצים

ההרצה נעשית ישירות דרך llama.cpp, מהטרמינל או כשרת מקומי עם פקודת llama-server או llama-cli. אפשר למשוך את הקובץ ישירות ממאגר Hugging Face ולהריץ אותו על המחשב עם מעבד רגיל של מק או לינוקס, ואפילו כרטיס מסך בסיסי עם ארבעה גיגה בייט זיכרון ייעודי יחזיק אותו בלי בעיה.

אם אתם צריכים לשרת אלפי בקשות במקביל או שאין לכם עניין לנהל שרתים פיזיים, שווה לפנות ל־API חיצוני. לעומת זאת, לבדיקות פנימיות, עבודה אופליין או מוצר שרץ כולו על מכשיר הקצה, להריץ את הקובץ הזה לבד זה פתרון מהיר וזול.

ollama run hf.co/hugging-quants/Llama-3.2-3B-Instruct-Q8_0-GGUF:Q8_0

הקבצים

3 קבצים במאגר, 3.2 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

בדף המודל הנוכחי לא דווח רישיון רשמי. בפועל מדובר בהמרה של מודל מבית מטא, אבל היעדר שדה הרישיון בקובץ אומר שאי אפשר להסתמך עליו משפטית בהפצה מסחרית לפני שבודקים ידנית את תנאי השימוש של דגם המקור המקורי.

הרישיון המלא בעמוד המודל ↗