GPT
L

Llama-3-ELYZA-JP-8B-GGUF

קוד פתוח

elyzallama32024-06-25

  • transformers
  • gguf
  • llama-cpp
  • ja
  • en

גרסה מכווצת ומותאמת ליפנית של לאמה 3 בגודל שמונה מיליארד פרמטרים. היא מיועדת למי שצריך להריץ מקומית עיבוד שפה ביפנית ובאנגלית בלי לשרוף משאבי שרת כבדים.

  • 4.6 GBמשקל הקבצים
  • 1,951הורדות בחודש
  • 75לייקים

מה זה

מדובר בהתאמה של מודל ההוראות המקורי מבית מטא, שעבר אימון מקדים נוסף וכוונון עדין בידי חברת אליזה כדי לשלוט ביפנית. הגרסה הזו מגיעה בפורמט קבצי GGUF עם כימות Q4_K_M, שנועד לאפשר ריצה מהירה על מעבדים ביתיים וכרטיסי מסך סטנדרטיים.

לפי המבחנים שהמפתחים פרסמו במדד המשימות שלהם מול ציון GPT4, מודל המקור הלא מכווץ קיבל 3.655 נקודות, גרסת ה־GGUF הזו יורדת ל־3.57, וגרסת AWQ מגיעה ל־3.39. המספרים האלה מראים שהכימות הספציפי הזה שומר כמעט לחלוטין על היכולת של מודל המקור, בניגוד לחלופת ה־AWQ שאיבדה יותר דיוק.

מתאים ל

  • עוזר מקומי ביפנית

    רץ ישירות על מחשב נייד דרך LM Studio ומספק שיחה שוטפת ביפנית בלי לשלוח מידע לרשת.

  • שרת API עצמאי

    הרמה מהירה של שרת תואם אופן איי איי באמצעות llama-server לעיבוד פניות באנגלית ויפנית.

  • אוטומציה מקומית לטקסט

    מיון ותמצות מסמכים ביפנית בתוך סביבה מבודדת שדורשת קבצים קלים ומשאבי מחשוב צנועים.

איפה זה נופל

המודל מוגדר רשמית רק ליפנית ולאנגלית. הוא לא מיועד לעברית, ואם תנסו לכתוב לו בשפות אחרות תקבלו פלט שבור או הזיות, כך שאין מה לחפש כאן מענה מקומי לישראל.

בנוסף, הכימות ל־4 ביט גורם בהכרח לאובדן דיוק קל במשימות מורכבות לעומת המודל המקורי, והוא מוגבל למעטפת הביצועים של שמונה מיליארד פרמטרים, שלא משתווה למודלים ענקיים בניתוח לוגי עמוק.

אותה משפחה

Llama-3-ELYZA-JP יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לטקסטים בעברית?

לא. המודל אומן והותאם ספציפית ליפנית ולאנגלית בלבד. כל ניסיון להזין עברית יוביל לתוצאות גרועות ולא מדויקות.

כמה זיכרון עבודה בפועל צריך כדי להריץ אותו חלק?

הקובץ שוקל 4.6 גיגה בייט, ולכן מחשב עם שמונה גיגה בייט זיכרון יריץ אותו בצורה בסיסית. כדי לקבל ביצועים טובים ולשלב הקשר ארוך, עדיף לעבוד עם שישה עשר גיגה זיכרון משותף או כרטיס מסך עם שמונה גיגה זיכרון ייעודי לפחות.

איך מריצים

את הקובץ במשקל 4.6 גיגה בייט מריצים ישירות עם llama.cpp, פקודת שרת פשוטה, או דרך ממשקים גרפיים כמו LM Studio. במחשב נייד עם מעבד M1 Pro, המפתחים מדווחים על קצב של כעשרים טוקנים בשנייה, כך שלא צריך כרטיס מסך תעשייתי כדי לקבל מהירות עבודה סבירה.

אם אתם צריכים את זה עבור משתמש יחיד, הרצה מקומית בזיכרון של שמונה עד שישה עשר גיגה תעשה את העבודה בלי תשלום נוסף. אם מדובר במערכת עם עומס משתמשים כבד, שרת מקומי ידרוש ניהול תורים ותשתיות, ושם כבר עדיף לבחון קריאות API לשירותים מנוהלים.

ollama run hf.co/elyza/Llama-3-ELYZA-JP-8B-GGUF:Q4_K_M

הקבצים

8 קבצים במאגר, 4.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא רישיון הקהילה של מטא עבור לאמה 3. הוא מתיר שימוש מסחרי ומחקר, בתנאי שמוסיפים את הייחוס המתאים ופועלים לפי מדיניות השימוש המקובלת של מטא.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗