GPT
S

saiga_nemo_12b_gguf

קוד פתוח

IlyaGusevapache-2.02024-11-03

  • gguf
  • ru
  • conversational

גרסה מכווצת של מודל 12B שמתמקדת ברוסית ומיועדת להרצה מקומית דרך llama.cpp. היא מתאימה למי שצריך עיבוד טקסט ברוסית בלי תלות ברשת.

  • 95.8 GBמשקל הקבצים
  • 3,068הורדות בחודש
  • 107לייקים

מה זה

המאגר הזה מציע המרות GGUF של מודל Saiga המבוסס על Mistral NeMo בגודל 12 מיליארד פרמטרים. המטרה המרכזית שלו היא עבודה ברוסית, שפה שבה רוב המודלים הפתוחים הבינוניים נוטים לקרטע או לייצר ניסוחים עילגים. היוצר לקח את מודל הבסיס והתאים אותו לשיחה והוראות ברוסית, כך שאתם מקבלים כלי שמבין את הדקויות של השפה הזו הרבה יותר טוב ממודל כללי באותו סדר גודל.

במקום להתעסק עם משקלים מלאים שדורשים כרטיסי מסך יקרים, הקבצים כאן מוכנים לטעינה ישירה במעבד או במאיץ גרפי ביתי. אין כאן נתוני מבחנים רשמיים בדף, אבל המיקוד בשפה אחת נותן לו יתרון ברור על פני מודלים רב-לשוניים שמנסים לדחוס עשרות שפות לאותו נפח זיכרון.

מתאים ל

  • בוט שירות ברוסית

    מענה לפניות לקוחות ברוסית על שרת מקומי, בלי להוציא מידע רגיש לענן.

  • סיכום מסמכים ברוסית

    חילוץ מידע וניתוח טקסטים ארוכים ברוסית ישירות על המחשב בלי עלויות API.

  • עוזר מקומי למחשב אישי

    הרצה מקומית דרך llama.cpp לעבודה יומיומית ברוסית על חומרה עם 16GB זיכרון.

איפה זה נופל

המודל מוגדר לשפה הרוסית בלבד. אל תצפו ממנו לתפקד בעברית או באנגלית באותה רמה, ואם האפליקציה שלכם דורשת מעבר בין שפות, הוא כנראה ייכשל. בנוסף, כרטיס המודל מינימליסטי מאוד, לא מציג ציוני בנצ'מרק, ולא מפרט על מגבלות בטיחות או נטייה להזיות, כך שחובה לבדוק את התשובות שלו ידנית לפני שמשלבים אותו בשירות פעיל.

אותה משפחה

saiga-nemo יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

כמה זיכרון דרוש בפועל כדי להריץ את המודל?

הגרסה הכבדה ביותר, q8_0, דורשת 15GB של RAM לפי נתוני היוצר. גרסאות קלות יותר כמו Q4 ירוצו על פחות מזה ויתאימו לרוב המחשבים עם 16GB זיכרון.

האם המודל מתאים לשימוש בעברית?

לא. המודל מיועד ומאומן ספציפית לרוסית, ואין לו תמיכה מוגדרת בעברית.

איך מריצים

מורידים קובץ בודד בפורמט GGUF, למשל את גרסת Q4_K_M, יחד עם סקריפט פייתון שהיוצר מספק. ההרצה דורשת התקנה של llama-cpp-python וספריית fire, ואז מפעילים את הסקריפט ישירות מול הקובץ שהורדתם.

מבחינת חומרה, גרסת q8_0 דורשת 15GB של זיכרון RAM, וגרסאות מכווצות יותר כמו Q4 יסתפקו בפחות מזה. אם אין לכם מחשב עם מספיק זיכרון פנוי או כרטיס מסך שיכול להאיץ את התהליך, עדיף לפנות ל־API חיצוני במקום לחכות שניות ארוכות לכל תשובה.

ollama run hf.co/IlyaGusev/saiga_nemo_12b_gguf:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו בקוד סגור, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗