GPT
H

h2o-danube2-1.8b-chat

קוד פתוח

h2oaiapache-2.02024-04-05

  • transformers
  • safetensors
  • mistral
  • text-generation
  • gpt

יש כאן גם סקירה על H2O AI עצמו.

מודל שיחה קומפקטי במיוחד שרץ בקלות מקומית על כרטיס מסך פשוט. הוא נותן מענה מהיר להוראות קצרות בלי לסחוב משקלים של עשרות גיגה-בייט.

  • 1.8Bפרמטרים
  • 8,192טוקנים בהקשר
  • 3.4 GBמשקל הקבצים
  • 1,504הורדות בחודש

מה זה

H2O לקחו את הארכיטקטורה של Llama 2, שילבו את הטוקנייזר של Mistral עם אוצר מילים של 32,000 מילים, וכיווצו את העסק לסדר גודל של 1.8 מיליארד פרמטרים. גרסת הצ'אט עברה אימון כפול שכולל SFT ו־DPO, ומציעה חלון הקשר של 8,192 טוקנים, שזה מרווח עבודה מכובד מאוד לגודל כזה.

במבחני הביצועים רואים בדיוק איפה המגבלות של הגודל פוגשות את המציאות. במבחן Hellaswag הוא עומד על 73.54 וב־Winogrande על 69.77, מה שאומר שהוא מסתדר לא רע בכלל עם השלמת משפטים והיגיון בסיסי. מנגד, ציון של 37.77 ב־MMLU וציון 26.16 במתמטיקה של GSM8K מבהירים שלא כדאי לבנות עליו לפילוסופיה או לחישובים מורכבים.

מתאים ל

  • עוזר שיחה מקומי ומהיר

    מענה לפקודות טקסט ישירות באנגלית על חומרה חלשה בלי להוציא נתונים לרשת.

  • סיווג ותמצות טקסטים

    ניתוח מסמכים קצרים בתוך חלון של 8,192 טוקנים כשהתקציב דורש ריצה זולה.

  • מענה ראשוני להודעות

    החזרת תשובות בסיסיות מוגדרות מראש תוך שימוש בתבנית הפרומפט המובנית של המודל.

איפה זה נופל

המודל מוגדר רשמית לאנגלית בלבד, כך שאין מה לבנות עליו לעברית. בנוסף, המפתחים מזהירים במפורש מתשובות שגויות, חוסר היגיון, והטיות שנובעות מנתוני האינטרנט שעליהם אומן. ציון של 39.96 ב־TruthfulQA וציון של 5.79 ב־MT-Bench מראים שהוא נוטה להזיות ולא מחזיק היטב שיחות רב-שלביות מורכבות.

אותה משפחה

h2o-danube2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להריץ אותו על שרת בלי כרטיס מסך ייעודי?

המשקל של המודל הוא 3.4 גיגה-בייט בלבד, כך שעם קוונטיזציה של 4 ביט אפשר טכנית להריץ אותו אפילו על זיכרון של מעבד רגיל. עם זאת, זמני התגובה בשיחה יהיו איטיים משמעותית בהשוואה לריצה על כרטיס מסך בסיסי.

האם המודל מתאים לפיתוח בוטים בעברית?

המודל הוכשר וסומן עבור השפה האנגלית בלבד, ולכן הוא לא יודע להתמודד עם עברית בצורה אמינה. עבור שימושים בשפה המקומית תצטרכו לאמן אותו מחדש או לבחור מודל רב-לשוני אחר.

איך מריצים

המשקל הכולל של הקבצים הוא 3.4 גיגה-בייט, כך שהוא יושב בלי בעיה בזיכרון של כל כרטיס מסך מודרני ברמת כניסה. מריצים אותו ישירות דרך ספריית transformers בפייתון עם bfloat16, ואפשר לדחוס אותו עוד יותר ל־4 ביט או 8 ביט כדי לפנות מקום לעוד תהליכים.

יש למשפחה הזו גם גרסת בסיס וגרסת SFT רגילה, אבל הגרסה הזו כוללת כבר יישור DPO לשיחה, כך שאין סיבה לקחת גרסה קודמת אלא אם אתם רוצים לאמן אותה מחדש. אם המטרה שלכם היא משימות ניתוח כבדות או שאתם צריכים דיוק עובדתי מוחלט, עדיף להשתמש ב־API של מודל ענק במקום להסתבך עם המגבלות של מודל קטן.

from transformers import pipeline

pipe = pipeline("text-generation", model="h2oai/h2o-danube2-1.8b-chat")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה של המודל בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים את נוסח הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗