GPT
Y

Yi-34B-200K

קוד פתוח

01-aiapache-2.02023-11-06

  • transformers
  • pytorch
  • safetensors
  • llama
  • text-generation

זה מודל בסיס של 34 מיליארד פרמטרים עם תמיכה בהקשר חריג של 200 אלף טוקנים. הוא פונה למי שצריך לעבד טקסטים ארוכים במיוחד דווקא באנגלית ובסינית, בלי לעבור למודלי ענק יקרים יותר.

  • 34Bפרמטרים
  • 200,000טוקנים בהקשר
  • 128 GBמשקל הקבצים
  • 8,969הורדות בחודש

מה זה

מדובר במודל שפה שאומן מאפס על שלושה טריליון טוקנים, תוך שימוש בארכיטקטורת Llama אך ללא שימוש במשקלים שלה. ההבדל המרכזי בינו לבין שאר גרסאות ה־34B הוא ההרחבה המובנית לחלון של 200,000 טוקנים, שמתאימה לספרים שלמים או מסמכים טכניים כבדים.

במבחן ה־Needle in a Haystack, שבודק יכולת איתור פרט בודד בתוך ים של מידע, היוצרים אימנו אותו על עוד חמישה מיליארד טוקנים כדי להעלות את הדיוק מ־89.3% ל־99.8%. זה אומר שבפועל הוא לא רק זוכר את תחילת המסמך וסופו, אלא באמת שולף עובדות מכל נקודה בהקשר הארוך.

הוא מיועד לתפקד כמנוע דו-לשוני באנגלית ובסינית, שם הוא דורג במקומות הראשונים בקטגוריית הקוד הפתוח במבחנים כמו C-Eval בעת פרסומו. עם זאת, זהו מודל בסיס גולמי, כלומר הוא לא עבר התאמה לשיחה ודורש פרומפטים מובנים להמשך טקסט או אימון נוסף.

מתאים ל

  • ניתוח מסמכים משפטיים ארוכים

    חלון של 200 אלף טוקנים מאפשר להזין חוזים שלמים או תיקים מלאים בבת אחת.

  • אימון מודל ייעודי לעסק

    מודל בסיס חזק שמתאים לכוונון עדין על דאטה פנימי בלי מגבלות של מודל שיחה קיים.

  • מחקר ותימצות ספרות באנגלית

    שליפת עובדות מדויקת של 99.8% לאורך כל עומק הטקסט ללא איבוד הקשר.

איפה זה נופל

זהו מודל בסיס ולא מודל שיחה, כך שהוא לא יענה לשאלות כמו צ'אטבוט אלא ימשיך את הטקסט שהזנתם. נתוני האימון שלו מעודכנים רק עד יוני 2023, ולכן הוא לא מכיר אירועים עדכניים. בנוסף, הוא אומן בעיקר על אנגלית וסינית, כך שביצועיו בעברית אינם מובטחים וצפויים להיות מוגבלים ביותר ללא אימון ייעודי.

אותה משפחה

Yi יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מתאים לצ'אט ישיר מול משתמשים?

לא באופן ישיר. מדובר בגרסת בסיס שממשיכה טקסט ולא עברה אימון הנחיות. לצורך שיחה עדיף להשתמש בגרסת Yi-34B-Chat או לאמן את המודל הזה על דאטה של שיחות.

כמה זיכרון GPU צריך כדי לנצל את כל ה־200K טוקנים?

הרבה מעבר לכרטיס בודד רגיל. המשקלים לבדם תופסים מעל 60 גיגה בזיכרון, וה־KV cache של 200 אלף טוקנים מוסיף עומס עצום, כך שדרוש שרת עם מספר כרטיסי A100 או A800.

איך מריצים

כדי להריץ אותו במשקלי bfloat16 מקוריים צריך לקחת בחשבון 128 גיגה של קבצים. זה דורש שרת עם כרטיס מקצועי כמו NVIDIA A800 של 80 גיגה לפחות, או שילוב של כמה מאיצים יחד, מה שהופך את ההרצה העצמית ליקרה ומסורבלת לתחנות עבודה רגילות.

אם יש מגבלת חומרה עדיף להוריד גרסאות מכווצות ב־4 או 8 ביט דרך GPTQ או AWQ, או פשוט לקרוא למודל דרך ספקי API כמו Replicate. שימוש ב־API חוסך את כל ניהול הזיכרון העצום שדורש חלון הקשר של 200 אלף טוקנים בזמן אמת.

from transformers import pipeline

pipe = pipeline("text-generation", model="01-ai/Yi-34B-200K")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים פתוחים תחת רישיון Apache 2.0 המאפשר שימוש מסחרי מלא, שינוי והפצה חופשית. עם זאת, החברה צירפה גם הסכם קהילתי משלה, ולכן חברות שמטמיעות אותו במוצר מסחרי צריכות לבדוק היטב את תנאי ההסכם הייעודי של 01-ai.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗