GPT
Y

YandexGPT-5-Lite-8B-instruct-GGUF

קוד פתוח

yandexother2025-03-28

  • gguf
  • ru
  • en
  • endpoints_compatible
  • imatrix

גרסת GGUF מכווצת למודל של יאנדקס שמכוונת ספציפית לרוסית ואנגלית. אם אתם צריכים עיבוד טקסט מהיר ברוסית על חומרה צנועה בלי לפנות לשרת חיצוני, זו כנראה הסיבה שאתם כאן.

  • 4.6 GBמשקל הקבצים
  • 4,042הורדות בחודש
  • 81לייקים

מה זה

מדובר במודל הוראות בגודל שמונה מיליארד פרמטרים ששוחרר על ידי יאנדקס ועבר קוונטיזציה כדי שיוכל לרוץ מקומית. רוב המודלים הפתוחים בגודל הזה מגיעים מהמערב ומתמקדים כמעט לחלוטין באנגלית. כאן הדגש הברור הוא על רוסית לצד אנגלית, וזה שינוי מורגש למי שעובד מול קהל דובר רוסית.

המשקל של הקבצים עומד על 4.6 גיגה בייט בלבד. זה אומר שהוא נכנס בקלות למעבדים גרפיים ביתיים ואפילו לזיכרון של מחשבים ניידים מודרניים. יאנדקס לא פרסמו פה טבלאות ביצועים מפורטות, אבל עצם ההתאמה לשפות האלה הופכת אותו למועמד מיידי למשימות לוקאליות מוגדרות.

מתאים ל

  • ניתוח טקסטים ברוסית מקומית

    הוא אומן על רוסית כמטרה ראשית ויכול לסווג או לחלץ מידע במחשב מקומי.

  • בוט פנימי לחברות

    מתאים לשרת פנימי שלא רוצה להוציא מידע רגיש באנגלית או ברוסית החוצה.

  • תמיכה באנגלית ורוסית במקביל

    תרגום קצר או עיבוד תוכן שמשלב בין שתי השפות בלי צורך במודל ענק.

איפה זה נופל

המודל משתמש בתבנית שיחה לא סטנדרטית שמסתמכת על תגובת עוזר בודדת אחרי מחרוזת מוגדרת וסיום עם טוקן ספציפי. יאנדקס מזהירים מפורשות שהרצה במצב שיחה אינטראקטיבי מובילה לתוצאות שונות מאשר שליחת פרומפט מקובע. בנוסף, הוא מוגבל לרוסית ואנגלית, כך שאין מה לבנות עליו למשימות בעברית.

אותה משפחה

YandexGPT-5-Lite יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בעברית?

הכרטיס מציין רשמית תמיכה ברוסית ובאנגלית בלבד. לא הייתי בונה עליו לעיבוד עברית כי הוא לא הוכשר לכך.

למה התשובות בצ'אט מרגישות מוזרות?

יאנדקס מציינים שהתבנית אומנה לייצר תשובה בודדת אחרי סמן מסוים. במצב צ'אט אינטראקטיבי התנהגות המודל משתנה, ולכן עדיף להריץ אותו דרך שרת ולא בשיחה חיה.

אפשר להריץ אותו בלי מעבד גרפי ייעודי?

כן, המשקל הוא 4.6 גיגה בייט ולכן llama.cpp יריץ אותו גם על מעבד רגיל עם מספיק זיכרון, אם כי הביצועים יהיו איטיים יותר.

איך מריצים

המודל מגיע מוכן להרצה דרך llama.cpp או ישירות דרך Ollama עם הפקודה ollama run yandex/YandexGPT-5-Lite-8B-instruct-GGUF. קובץ ה־Q4_K_M דורש סביב חמישה עד שמונה גיגה בייט של זיכרון כדי לעבוד חלק עם הקשר של 32k טוקנים. שרת מקומי עם מעבד גרפי פשוט יחזיק אותו בלי בעיה.

אם אתם צריכים שירות יציב לעשרות משתמשים במקביל ואין לכם שרת ייעודי פנוי, עדיף להשתמש ב־API מרוחק. הרצה מקומית ב־llama-cli מתאימה בעיקר לבדיקות ראשוניות, לא לייצור.

ollama run hf.co/yandex/YandexGPT-5-Lite-8B-instruct-GGUF:Q4_K_M

הקבצים

4 קבצים במאגר, 4.6 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ולא מפורט בקובץ הנוכחי. יאנדקס מפנים לריפו המקורי שלהם, מה שאומר שאסור להניח שמדובר בקוד פתוח חופשי לשימוש מסחרי. לפני שאתם משלבים אותו במוצר שמייצר הכנסות, אתם חייבים לבדוק את תנאי השימוש המדויקים במאגר המקורי.

הרישיון המלא בעמוד המודל ↗