GPT
S

saiga_llama3_8b_gguf

קוד פתוח

IlyaGusevother2024-04-19

  • gguf
  • text-generation
  • ru
  • conversational

גרסה מכווצת של מודל המבוסס על לאמה 3, שמיועדת במיוחד לעבודה ברוסית. אם אתם צריכים להריץ מודל שיחה ברוסית מקומית על מעבד או זיכרון מוגבל, בשביל זה הכינו אותו.

  • 30.5 GBמשקל הקבצים
  • 1,797הורדות בחודש
  • 91לייקים

מה זה

מדובר בהמרה לפורמט GGUF של מודל Saiga 8B, כוונון של לאמה 3 לרוסית שאיליה גוסב פרסם באפריל 2024. המטרה כאן היא יצירת טקסט ושיחה, כשהפוקוס המובהק הוא השפה הרוסית על גבי התשתית החזקה של מטא.

ההבדל מול מודלים רגילים בגודל שמונה מיליארד פרמטרים נובע מהשפה. לאמה 3 המקורית יודעת רוסית אבל לא מתמחה בה, וכאן הדגש כולו הושם על תגובות טבעיות ברוסית. בגלל שמדובר בקובצי GGUF, אפשר להריץ אותו ישירות דרך llama.cpp בלי שרת כבד ובלי להסתבך עם ספריות מסובכות.

מתאים ל

  • צ'אטבוט מקומי ברוסית

    מתאים לשיחה טבעית ברוסית על חומרה ביתית או משרדית, בלי להוציא מידע לרשת.

  • עיבוד טקסטים ברוסית

    ניתוח וסיכום של טקסטים קצרים ברוסית כשחייבים ריצה מקומית ומהירה דרך המעבד.

  • פיתוח אפליקציות אופליין

    שילוב יכולות טקסט ברוסית בתוכנות שפועלות ללא חיבור אינטרנט ובזיכרון נמוך מ־10GB.

איפה זה נופל

המודל הזה מכוון כמעט בלעדית לרוסית, כך שאם אתם בונים פרויקט שכולל עברית או אנגלית ברמה גבוהה, הוא לא מתאים. מעבר לזה, מדובר במודל של שמונה מיליארד פרמטרים, אז משימות היגיון מורכבות או הבנת הקשרים ארוכים במיוחד עלולות לחשוף טעויות עובדתיות והזיות.

אותה משפחה

saiga-llama3 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב בלי כרטיס מסך ייעודי?

כן, קובצי GGUF מיועדים לעבודה דרך llama.cpp על גבי המעבד הרגיל. אם לוקחים גרסה מכווצת כמו q4, צריך פחות מ־10GB זיכרון RAM כדי שהוא יעבוד בצורה סבירה.

האם המודל תומך בעברית?

לא, המודל אומן והוגדר עבור רוסית בלבד. הוא אולי יפלוט מילים בודדות בעברית בגלל הבסיס של לאמה, אבל לא הייתי בונה עליו לשום דבר מעבר לרוסית.

איך מריצים

מורידים את אחד מקובצי ה־GGUF, למשל גרסת model-q4_K.gguf, מורידים סקריפט פייתון ייעודי שהיוצר סיפק, ומתקינים את הספריות llama-cpp-python ו־fire. משם מריצים פקודה פשוטה בטרמינל כדי לפתוח שיחה.

לפי דרישות המערכת, גרסת ה־q8_0 דורשת 10GB של זיכרון RAM, וגרסאות מכווצות יותר דורשות פחות מזה. אם יש לכם מחשב סביר אפשר להריץ הכל מקומית, אבל אם המטרה היא עומס של עשרות משתמשים בו־זמנית, שרת API חיצוני יחסוך את צוואר הבקבוק של החומרה.

ollama run hf.co/IlyaGusev/saiga_llama3_8b_gguf:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

6 קבצים במאגר, 30.5 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other בלבד, ולא צוין רישיון קוד פתוח מוכר. לפני שמשלבים את הקבצים במוצר מסחרי, חייבים לבדוק את תנאי השימוש של מודל המקור והפרויקט כדי לוודא שאין הגבלות הפצה.

הרישיון המלא בעמוד המודל ↗