GPT
Y

Yi-34B-Chat

קוד פתוח

01-aiרישיון לא דווח2023-11-22

  • transformers
  • safetensors
  • llama
  • text-generation
  • conversational

מודל שיחה של 34 מיליארד פרמטרים שמתאים לחברות שמחפשות ביצועים חזקים בלי לתחזק מפלצת של 70 מיליארד. הוא אומן מאפס על שלושה טריליון טוקנים באנגלית ובסינית, ומגיע מוכן לשיחה.

  • 4,096טוקנים בהקשר
  • 64.1 GBמשקל הקבצים
  • 26,109הורדות בחודש
  • 358לייקים

מה זה

המודל הזה נבנה על בסיס ארכיטקטורת Llama אך אומן על משקלים עצמאיים לחלוטין. הוא פותח כמודל דו לשוני מובהק לאנגלית ולסינית על גבי דאטה רחב, ועבר אימון ייעודי להוראות באמצעות Supervised Fine-Tuning בלבד. במבחני AlpacaEval מתחילת 2024 גרסת השיחה הזו הגיעה למקום השני מיד אחרי GPT-4 Turbo, תוך שהיא עוקפת מודלים כמו Claude ו־Mixtral. המשמעות בפועל היא יכולת ניסוח ויצירתיות גבוהה מאוד באנגלית, לצד הבנה חזקה של הקשרים מורכבים. מנגד, חלון ההקשר בגרסה הזו עומד על 4,096 טוקנים בלבד, כך שלא תוכלו לזרוק אליו מסמכים ענקיים כמו בגרסאות ה־200K של אותה סדרה.

מתאים ל

  • עוזרי שיחה וכתיבה יצירתית

    אימון ה־SFT הייחודי מייצר ניסוחים פחות רובוטיים ויותר מגוונים במענה למשתמשים.

  • תרגום אנגלית וסינית

    דאטה ייעודי של שלושה טריליון טוקנים הפך אותו לאחד החזקים בעולם בשילוב השפות הזה.

  • חלופה למודלי ענק

    מספק יכולות שמתקרבות למודלים גדולים בהרבה אבל בחצי מכוח החישוב הנדרש להם.

איפה זה נופל

היוצרים מודים בפירוש שהאימון הסתמך על SFT בלבד בלי שלב של Reinforcement Learning, מה שהופך את התשובות למגוונות יותר אבל מייצר שלוש בעיות קשות. יש כאן נטייה מוגברת להזיות עובדתיות, חוסר עקביות בתשובות שמקבלים באותם תנאים, ושגיאות מצטברות במשימות ארוכות כמו פתרון בעיות מתמטיות. כדי לרסן אותו חייבים לשחק ידנית עם ערכי הטמפרטורה והדגימה, ולא הייתי סומך עליו במערכות שדורשות דיוק עובדתי מוחלט ללא בדיקה קפדנית.

אותה משפחה

Yi יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על תחנת עבודה רגילה?

בגרסה המקורית לא, כי נדרשים מעל 64 גיגה בייט של זיכרון בכרטיס המסך רק כדי לטעון אותו. אם אתם עובדים על חומרה ביתית, עדיף להוריד את גרסאות ה־4bit או 8bit שהחברה שחררה או לפנות ל־API חיצוני.

האם הוא מתאים לקריאת קבצים ארוכים?

לא בגרסה הזו. המודל מוגבל לחלון של 4,096 טוקנים בלבד, כך שהוא מיועד בעיקר לשיחות קצרות ולתשובות ממוקדות ולא לניתוח ספרים או דוחות ארוכים.

האם הוא נותן תוצאות עקביות בכל הרצה?

לא תמיד. בגלל היעדר שלב אימון מסוג RL, המודל נוטה לייצר תשובות שונות מאוד באותן שאלות. כדי לייצב אותו תצטרכו להוריד את הטמפרטורה ולהגדיר פרמטרים שמרניים יותר בזמן הריצה.

איך מריצים

כדי להריץ את הגרסה המלאה בדיוק bfloat16 תצטרכו לפחות 64.1 גיגה בייט של זיכרון וידאו, מה שמחייב מעשית כרטיס שרת רציני כמו A800 של 80 גיגה בייט או מערך כרטיסים. אם יש לכם מחשב מקומי רגיל עם כרטיסי RTX 3090 או 4090, תצטרכו לוותר על המשקלים המקוריים ולעבור לגרסאות המכווצות שהחברה שחררה בארבעה או שמונה ביטים. מי שרוצה לחסוך תחזוקת שרתים יכול לצרוך אותו דרך Replicate או ה־API הרשמי שלהם. ההרצה המקומית בקוד פשוטה מאוד ומשתמשת בספריית transformers הרגילה דרך מתודת apply_chat_template.

from transformers import pipeline

pipe = pipeline("text-generation", model="01-ai/Yi-34B-Chat")
print(pipe("שלום"))

הרישיון

בעמוד המודל לא דווח רישיון רשמי. המשמעות היא שאין לכם כרגע אישור ברור בחומר הנתון להשתמש בו במוצר מסחרי, וכל שימוש כזה דורש בירור מעמיק של תנאי השימוש מול החברה כדי לא להסתכן בהפרת זכויות יוצרים.

הרישיון המלא בעמוד המודל ↗