GPT
H

h2o-danube3-500m-chat

קוד פתוח

h2oaiapache-2.02024-07-04

  • transformers
  • onnx
  • safetensors
  • llama
  • text-generation

יש כאן גם סקירה על H2O AI עצמו.

מודל שיחה זעיר שרץ ישירות על טלפונים ניידים בלי חיבור רשת. פתרון מתאים למי שחייב עיבוד טקסט מקומי באנגלית בלי עלויות שרתים.

  • 514Mפרמטרים
  • 8,192טוקנים בהקשר
  • 6.5 GBמשקל הקבצים
  • 75,920הורדות בחודש

מה זה

מדובר במודל שפה קטן במיוחד, עם כחצי מיליארד פרמטרים, שמבוסס על התאמה של ארכיטקטורת Llama 2 ומשתמש בטוקנייזר של מיסטרל. הוא מיועד לייצור טקסט ושיחה, ומגיע מאומן לחלון הקשר של 8,192 טוקנים, שזה מרחב עבודה נדיב למדי ביחס למשקל שלו.

במבחני הביצועים של Open LLM Leaderboard v1 הוא הגיע לציון ממוצע של 40.71. הוא מציג תוצאות סבירות במשימות השלמת משפטים כמו Hellaswag ו־Winogrande עם קצת מעל שישים אחוז, אבל מתקשה מאוד בידע כללי רחב, שבו קיבל 26.33 ב־MMLU, ונופל לגמרי במתמטיקה עם 16 אחוז בלבד ב־GSM8K.

מתאים ל

  • עוזר שיחה אופליין לנייד

    הוא מתוכנן לרוץ ישירות על מעבד של טלפון ללא שרתים, מה שמאפשר מענה מהיר ופרטיות מלאה.

  • עיבוד פניות קצרות באנגלית

    מתאים לסיעור מוחות או ניסוח הודעות פשוטות בתוך ממשק מקומי בלי תלות ברשת.

  • מיון טקסט במשאבים מוגבלים

    הגודל הזעיר מאפשר להעלות אותו לכרטיסי מסך חלשים לצורך השלמת משפטים מהירה.

איפה זה נופל

היוצרים מבהירים שהמודל אומן על מידע רחב מהאינטרנט ועלול לפלוט הטיות, תוכן פוגעני או תשובות חסרות משמעות לחלוטין. במבחן השיחה MT-Bench הוא השיג ציון של 4.16 בסיבוב הראשון, אבל קרס ל־2.40 בסיבוב השני, מה שאומר שהוא מתקשה לשמור על הקשר בשיחות מתמשכות. תוצאה של 16 אחוז ב־GSM8K פוסלת אותו לכל חישוב כמותי, והוא מוגדר לשפה האנגלית בלבד, כך שאין מה לבנות עליו לעברית.

אותה משפחה

h2o-danube3 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה עם נתונים בעברית?

לא. המודל הוגדר ואומן על השפה האנגלית בלבד. הוא לא יזהה כראוי קלט עברי ויחזיר פלט שבור או חסר משמעות לחלוטין.

האם הוא מסוגל לנהל צ'אט ארוך עם משתמש?

לא מומלץ לבנות עליו לזה. במבחן MT-Bench הציון שלו צנח מ־4.16 בפנייה הראשונה ל־2.40 בלבד בפנייה השנייה, כך שקשה לו לעקוב אחרי שיחה מתגלגלת.

איך מריצים

אתם יכולים לטעון אותו ישירות דרך ספריית transformers בגרסה 4.42.3 ומעלה באמצעות צינור text-generation רגיל ב־bfloat16. משקל הקבצים עומד על 6.5 ג'יגה בייט בחלוקה לשבעה עשר קבצים, והוא תומך בקוונטיזציה של 4 ביט או 8 ביט כדי לחסוך זיכרון ולרוץ גם על מאיצים גרפיים קטנים או מעבדי טלפון נייד.

הוא קיים בשתי גרסאות, גרסת בסיס וגרסת שיחה שעברה התאמה עם תבנית פרומפט ייעודית. אם אתם צריכים לפתור בעיות היגיון מורכבות או לחשב מספרים, אין טעם להריץ אותו מקומית, ועדיף לקרוא ל־API חיצוני של מודל גדול בהרבה.

from transformers import pipeline

pipe = pipeline("text-generation", model="h2oai/h2o-danube3-500m-chat")
print(pipe("שלום"))

הרישיון

רישיון apache-2.0 מתיר שימוש מסחרי חופשי לחלוטין. אתם יכולים לשנות את הקוד והמשקולות, להטמיע אותם בתוך מוצר סגור ולהפיץ אותו ללקוחות, בלי לשלם תמלוגים, כל עוד אתם שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗