GPT
Y

Yi-9B-200K

קוד פתוח

01-aiapache-2.02024-03-15

  • transformers
  • safetensors
  • llama
  • text-generation
  • text-generation-inference

שילוב בין גודל של כמעט תשעה מיליארד פרמטרים לחלון הקשר עצום של 200K טוקנים. הוא נבנה עבור מי שצריך לעבד טקסטים ארוכים במיוחד בלי לקרוע את התקציב על מודלי ענק.

  • 8.8Bפרמטרים
  • 262,144טוקנים בהקשר
  • 16.5 GBמשקל הקבצים
  • 8,830הורדות בחודש

מה זה

מדובר במודל שפה פתוח שנשען על ארכיטקטורת Llama, אבל אומן מאפס על ידי 01.AI ולא משתמש במשקלים שלה. הדגם הספציפי הזה הוא גרסת בסיס שנבנתה כהמשך אימון ישיר לדגם של שישה מיליארד פרמטרים, עם תוספת של 0.8T טוקנים. לפי נתוני היוצרים, הדגש בסדרה הזו הושם על יכולות קוד, מתמטיקה, הבנת הנקרא והסקה בסיסית באנגלית ובסינית, שם הוא מציג ביצועים גבוהים יותר ביחס לדגמים בגודל שבעה עד אחד עשר מיליארד.

הייחוד המרכזי כאן מול מודלים מקבילים בקטגוריית הגודל הזו הוא חלון ההקשר. בעוד רוב הדגמים הקטנים עוצרים בארבעה עד שלושים ושניים אלף טוקנים, כאן יש תמיכה מובנית ברבע מיליון טוקנים, כ־400 אלף תווים בסינית. זה מאפשר להזין תיעוד טכני מלא, בסיסי קוד שלמים או מאמרים ארוכים ישירות לתוך הפרומפט, בתנאי שהחומרה שלכם מסוגלת לשאת את הזיכרון הנדרש לפעולה כזו.

מתאים ל

  • ניתוח מסמכים ארוכים

    ההקשר של 200K מאפשר להזין דוחות עתירי מלל ומחקרים שלמים לקריאה רציפה.

  • אימון ייעודי למשימות קוד

    בסיס של 9B עם דגש על מתמטיקה וקוד, שמתאים לבניית כלי פיתוח פנימיים.

  • עיבוד טקסט דו־לשוני

    מתאים במיוחד למערכות שמתמקדות בתרגום ועיבוד מידע המשלב אנגלית וסינית.

איפה זה נופל

זהו מודל בסיס ולא מודל צ'אט, כלומר הוא לא עבר התאמה להוראות ונוטה להשלים טקסט במקום לענות לשאלות. החומר של הדגם מדגיש כי נתוני האימון מעודכנים רק עד יוני 2023, כך שכל מידע מאוחר יותר אינו קיים בו. בנוסף, הדגם מותאם בעיקר לאנגלית ולסינית, ולכן אינו מיועד למשימות הדורשות עברית טבעית ומדויקת. אם אתם צריכים עוזר שיחה מוכן לשימוש, תצטרכו לאמן אותו בעצמכם או לבחור מודל שכבר עבר fine-tuning מתאים.

אותה משפחה

Yi יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו ישירות כבוט שיחה באפליקציה?

לא מומלץ ישר מהקופסה. זהו מודל בסיס שנועד להשלמת טקסט, ולא עבר כוונון ייעודי למענה על שאלות או שיחה. כדי להשתמש בו במוצר מול משתמשי קצה צריך לאמן אותו או להשתמש בגרסת Chat מקבילה.

האם כרטיס מסך ביתי יספיק לניצול מלא של המודל?

לטעינה של המודל ויצירת טקסט קצר כרטיס של 24 גיגה־בייט יספיק. עם זאת, אם תנסו להעמיס עליו עשרות אלפי טוקנים, תזדקקו לזיכרון גדול בהרבה עבור הנתונים הזמניים, או שתחויבו להשתמש בכימות כמו 4-bit.

איך מריצים

המשקלים בפורמט bfloat16 תופסים כ־16.5 גיגה־בייט. כדי רק לטעון אותם לזיכרון תצטרכו כרטיס עם 24 גיגה־בייט כמו RTX 3090 או 4090, אבל שימו לב שהמספר הזה מטעה. ברגע שתתחילו לנצל את חלון ההקשר העצום, זיכרון ה־KV Cache יזנק בעשרות גיגה־בייט נוספים, ולכן להרצה של טקסטים ארוכים באמת תצטרכו כרטיסים מקצועיים כמו A800 של 80 גיגה־בייט או שימוש בכימות דרך ספריות כמו llama.cpp.

אם אין לכם שרת ייעודי כזה בבית או בענן, הרצה עצמית במלוא ההקשר הופכת לסיפור יקר ומסורבל. במצבים כאלה, בעיקר לפרויקטים בשלב הניסוי, פשוט יותר וזול בהרבה לגשת למודל דרך ספקי API חיצוניים שתומכים בו, כמו שירותי הענן של היוצרים או דרך Replicate, במקום לתחזק שרת כבד רק בשביל הזיכרון הגרפי.

from transformers import pipeline

pipe = pipeline("text-generation", model="01-ai/Yi-9B-200K")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה חוזרת של המערכת ללא תשלום תמלוגים, כל עוד שומרים על הודעות זכויות היוצרים המקוריות ומצרפים עותק של תנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗