GPT
T

Tencent-Hunyuan-Large

קוד פתוח

tencentother2024-10-22

  • transformers
  • safetensors
  • text-generation
  • en
  • eval-results

מודל ענק בארכיטקטורת מומחים שמפעיל רק חלק קטן מכוח החישוב בכל שלב. הוא מיועד למי שמחפש ביצועים של מודלים מובילים בלי לשלם את מלוא מחיר העיבוד של מודל מלא.

  • 1.8 TBמשקל הקבצים
  • 394הורדות בחודש
  • 617לייקים

מה זה

מדובר במודל MoE עם 389 מיליארד פרמטרים בסך הכול, אבל רק 52 מיליארד מהם מופעלים בכל טוקן נתון. המבנה הזה נותן לו יתרון מהירות ויעילות בהשוואה למודלים צפופים באותו סדר גודל כולל. כדי להתמודד עם עומסי זיכרון בהקשרים ארוכים, החוקרים הכניסו שילוב של Grouped Query Attention יחד עם Cross Layer Attention שמקטינים את נפח הזיכרון של ה־KV Cache.

במבחני ביצועים הוא עוקף את Llama 3.1 405B בחישובים מתמטיים כמו MATH עם 77.4 מול 73.8, ובמבחני ידע רחבים כמו MMLU. עם זאת, הוא לא מנצח בכל תחום. במבחני הבנה מדעית מורכבת כמו GPQA Diamond הוא מגיע ל־42.4, תוצאה שנמוכה משמעותית מזו של מודל הדגל של מטא.

מתאים ל

  • פתרון בעיות מתמטיקה

    משיג תוצאה של 77.4 במבחן MATH, ציון גבוה מזה של Llama 3.1 405B.

  • ניתוח מסמכים ארוכים

    תומך בחלון הקשר של עד 128K בגרסת ההוראות ו־256K בגרסת הבסיס.

  • פיתוח קוד

    מגיע ל־90 במבחן HumanEval, מה שמציב אותו ברמה גבוהה לכתיבת קוד.

איפה זה נופל

במבחן החשיבה המדעית GPQA Diamond המודל קיבל ציון של 42.4 בלבד, נמוך בהרבה מ־51.1 של Llama 3.1 405B. גם במבחני מעקב אחרי הוראות מדויקות כמו IFEval הוא לא שובר שיאים ונשאר מאחור. בנוסף, למרות תוצאות מרשימות במבחנים סיניים, הכרטיס מציין רק אנגלית כשפה נתמכת רשמית, ואין שום מידע על תמיכה או ביצועים בעברית.

שאלות
נפוצות

אפשר להריץ את המודל על שרת יחיד עם כרטיס RTX 4090?

לא. משקל הקבצים לבדו עומד על 1.8 טרה-בייט. תצטרכו מערך מרובה שרתי GPU עם מאות גיגה-בייט של VRAM רק כדי לטעון את המשקלים לזיכרון.

מה ההבדל בין גרסת הבסיס לגרסת ה־Instruct?

גרסת הבסיס תומכת בחלון הקשר של עד 256K טוקנים ומתאימה לאימון נוסף. גרסת ההוראות תומכת בעד 128K ומגיעה מכווננת למענה על שאלות ושיחה, כולל גרסת FP8 מכווצת.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־1.8 טרה-בייט שמתפרסים על פני מאות קבצים. כדי להחזיק מפלצת כזו בזיכרון צריך אשכול שרתים רציני עם כמה שרתי GPU מרובי כרטיסים בעלי זיכרון גבוה, אפילו אם משתמשים בגרסת ה־FP8 שמקצצת בדרישות. אפשר להרים אותו מעשית דרך vLLM לפי המדריכים של הפרויקט, או להמתין לתמיכה ב־TRT-LLM.

אם אין לכם תשתית ענן ארגונית מסיבית ותקציב חומרה כבד, עדיף בהרבה לפנות ישירות ל־API שהחברה מציעה בענן שלה. הרצה עצמית של מודל בגודל הזה הגיונית רק לארגונים שחייבים את כל המידע והמשקלים בתוך שרתים מבודדים לחלוטין.

from transformers import pipeline

pipe = pipeline("text-generation", model="tencent/Tencent-Hunyuan-Large")
print(pipe("שלום"))

הקבצים

275 קבצים במאגר, 1.8 TB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other ולא כרישיון קוד פתוח סטנדרטי כמו אפאצ׳י או MIT. המשמעות היא שיש תנאי שימוש ייעודיים שצריך לבדוק ישירות במאגר לפני שמשלבים אותו במוצר מסחרי, ולא ניתן להניח שהוא חופשי לכל שימוש ללא מגבלות.

הרישיון המלא בעמוד המודל ↗