GPT
R

ruGPT-3.5-13B

קוד פתוח

ai-forevermit2023-05-02

  • transformers
  • pytorch
  • gpt2
  • text-generation
  • gpt3

מודל שפה של 13 מיליארד פרמטרים שמתמקד ברוסית. הוא משמש כבסיס למי שצריך עיבוד טקסט רוסי, קוד או מסמכים משפטיים מקומיים בלי להסתמך על ענן חיצוני.

  • 2,048טוקנים בהקשר
  • 49.0 GBמשקל הקבצים
  • 564הורדות בחודש
  • 297לייקים

מה זה

מדובר במודל מבוסס ארכיטקטורת GPT-2 שאומן מראש על 300 גיגה-בייט של טקסטים מגוונים, ואז עבר אימון נוסף על עוד 100 גיגה-בייט של קוד ומסמכים משפטיים. החוקרים השתמשו בסינון כפול של דה-דופליקציה עם האשינג ודחיסת zlib כדי להעיף זבל, ואימנו אותו במשך חודשים על מאות מעבדים גרפיים מסוג V100 ו־A100.

התוצאה היא מודל שמגיע לערך פרפלקסיטי של בערך 8.8 ברוסית. במילים פשוטות, הוא מבין ומייצר רוסית בצורה טבעית יחסית למודלים ישנים, והוא שימש כבסיס לפרויקט GigaChat. מעבר לרוסית יש לו תמיכה מסוימת באנגלית ובכתיבת קוד, אבל הדגש הברור פה הוא שפה סלבית ומקורות מידע מקומיים.

מתאים ל

  • השלמת טקסטים משפטיים

    הוא עבר אימון ייעודי על 100 גיגה-בייט של מסמכים משפטיים ברוסית ומכיר את הניסוחים התחביריים בתחום.

  • בסיס לאימון נוסף ברוסית

    13 מיליארד פרמטרים שכבר מכילים אוצר מילים רוסי עשיר וציון פרפלקסיטי נמוך שמתאים להתחלת fine-tuning.

  • סיוע בכתיבת קוד מקומי

    המאגר שלו כולל נתוני קוד לצד השפה הרוסית, מה שמאפשר לייצר פונקציות והסברים בשפה זו.

איפה זה נופל

חלון ההקשר עומד על 2,048 טוקנים בלבד. אי אפשר לזרוק עליו מסמכים ארוכים או לצפות ממנו לנהל שיחות מורכבות שנמשכות מעבר לכמה פסקאות. בנוסף, מדובר במודל גנרטיבי בסיסי להשלמת טקסט ולא במודל שעבר התאמה לשיחה מודרנית עם פקודות ישירות, כך שצריך להנדס פרומפטים ישנים ולהגדיר פרמטרים כמו beam search כדי לקבל משהו קוהרנטי.

שאלות
נפוצות

האם המודל מבין או מייצר עברית?

המודל הוגדר ואומן על רוסית ואנגלית בלבד. אין לו תמיכה רשמית בעברית, ולא כדאי לבנות עליו לפרויקטים מקומיים שאינם כוללים קהל יעד דובר רוסית.

האם אפשר להריץ אותו ישר כצ'אטבוט?

לא מדובר במודל מסוג Instruct או Chat שעונה לשאלות ישירות. תצטרכו לנסח את הקלט כהתחלה של משפט שהמודל צריך להשלים, או להריץ אימון נוסף על הוראות.

איך מריצים

המשקלים יושבים ב־15 קבצים ששוקלים יחד 49 גיגה-בייט, ונשמרו במקור בפורמט float32. כדי לטעון אותו כמו שהוא תצטרכו לפחות 50 עד 60 גיגה-בייט של זיכרון וידאו, מה שמחייב שני כרטיסי A100 או שתמירו אותו לדיוק נמוך יותר לפני שרצים לחומרה ביתית.

ההרצה עצמה נעשית דרך ספריית transformers הרגילה בפייתון. אם אתם לא מחזיקים שרת ייעודי ורק צריכים כמה שאילתות בודדות ביום, עלויות הברזלים של מודל כזה לא משתלמות ועדיף לבדוק שירותי ענן.

from transformers import pipeline

pipe = pipeline("text-generation", model="ai-forever/ruGPT-3.5-13B")
print(pipe("שלום"))

הרישיון

המודל שוחרר תחת רישיון MIT. המשמעות היא שאתם חופשיים לחלוטין לקחת אותו, לשנות, להטמיע במוצר מסחרי ולהפיץ אותו, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗