GPT
E

ELYZA-japanese-Llama-2-7b-fast-instruct-gguf

קוד פתוח

mmngallama22023-08-29

  • gguf
  • llama2
  • ja
  • endpoints_compatible

התאמה יפנית מהירה של מטא שמיועדת להרצה מקומית קלה. פתרון ממוקד למי שבונה שירותים ביפנית ורוצה ביצועים בלי לשלם על כל טוקן לענן.

  • 48.6 GBמשקל הקבצים
  • 1,864הורדות בחודש
  • 45לייקים

מה זה

מדובר בהמרה לפורמט GGUF של דגם ההוראות היפני שיצרה ELYZA, המבוסס במקור על Llama 2 בגודל שבעה מיליארד פרמטרים. ההבדל המרכזי כאן מול גרסאות רגילות של הדגם הוא הרחבת אוצר המילים ביפנית, מה שמקטין את פירוק המילים להמון טוקנים קטנים.

לפי נתוני היוצר, שינוי המילון מביא למהירות עיבוד של פי 1.8 לעומת הגרסה הסטנדרטית, לצד חיסכון משמעותי במשאבי חישוב. המודל עבר כוונון ייעודי למענה על הוראות ביפנית, כך שהוא מבין בקשות מובנות ומגיב בצורה ישירה דרך ממשק פקודה רגיל של llama.cpp.

מתאים ל

  • בוט הוראות ביפנית

    מענה מהיר ומקומי לפניות משתמשים ביפנית בזכות הרחבת הטוקנים.

  • הרצה על חומרת קצה

    הפעלת מודל שפה מקומית ללא חיבור רשת דרך llama.cpp.

  • יצירת תוכן קצר ביפנית

    כתיבת סיפורים קצרים וטקסטים פשוטים לפי הנחיות מוגדרות.

איפה זה נופל

המודל אומן באופן בלעדי כמעט על יפנית ואנגלית של Llama 2, ולכן הוא לא מבין עברית ולא יחזיר בה תשובות סבירות. מעבר לזה, בסיס 7B מתקשה בהסקה לוגית מורכבת, קוד מתקדם או עמידה בהנחיות ארוכות בלי לסטות מהנושא.

שאלות
נפוצות

האם המודל תומך בעברית?

לא. המודל מתמקד ביפנית ומבוסס על ידע באנגלית בלבד. ניסיון לשלוח אליו קלט בעברית יפיק ג'יבריש או שגיאות הבנה חמורות.

מה המשמעות של גרסת Fast?

היא כוללת מילון טוקנים מורחב ליפנית. זה מאפשר לו לייצר טקסט מהר פי 1.8 ולצרוך פחות כוח חישוב על כל מילה כתובה.

איך מריצים

מורידים את קובץ ה־GGUF המתאים ומריצים ישירות באמצעות llama.cpp דרך שורת הפקודה. המשקל הכולל של כל הקבצים במאגר מגיע ל־48.6 גיגה-בייט בגלל פיצול לרמות כימות שונות, אבל כדי להריץ קובץ בודד כמו q4 תצטרכו מחשב פשוט יחסית עם מעבד סביר וכ־8 עד 16 גיגה-בייט זיכרון פנימי.

אם אתם לא צריכים שמירה מקומית על פרטיות או הרצה אופליין, לפעמים פשוט וזול יותר לפנות למודל גדול בענן דרך API מאשר לנהל תשתית והקצאת זיכרון בעצמכם.

ollama run hf.co/mmnga/ELYZA-japanese-Llama-2-7b-fast-instruct-gguf:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא רישיון הקהילה של Llama 2 מבית מטא. הוא מאפשר שימוש מסחרי ומחקר באופן חופשי לרוב הפרויקטים, אך דורש עמידה במגבלות השימוש המקובלות של מטא ואישור מיוחד רק אם השירות שלכם חוצה מאות מיליוני משתמשים פעילים בחודש.

  • שימוש מסחרי עד 700 מיליון משתמשים
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗