GPT
O

Orion-14B-Chat

קוד פתוח

OrionStarAIרישיון לא דווח2024-01-16

  • transformers
  • pytorch
  • gguf
  • orion
  • text-generation

מודל שיחה בגודל 14 מיליארד פרמטרים שמתמקד בשפות מזרח אסיה. הוא מיועד למי שצריך תמיכה חזקה בקוריאנית, יפנית או סינית ומחפש מודל שניתן להריץ מקומית.

  • 4,096טוקנים בהקשר
  • 54.0 GBמשקל הקבצים
  • 7,263הורדות בחודש
  • 68לייקים

מה זה

המודל אומן מאפס על מאגר נתונים של 2.5 טריליון טוקנים, בדגש מובהק על אנגלית, סינית, יפנית וקוריאנית. במבחני שפה ממוקדים ביפנית וקוריאנית, כמו מבחני הבנת הנקרא ובחירה מרובה, הוא מציג ציונים שעוקפים מודלים ותיקים באותו סדר גודל כמו LLaMA 2 ואפילו מודלים ייעודיים לשפות האלה.

במדדי שיחה כלליים כמו MTBench הוא קיבל ציון ממוצע של 7.37, שזה מעט מעל Baichuan2 ו־Qwen מאותו המחזור. לעומת זאת, במבחני מתמטיקה ולוגיקה בסיסית בתוך AlignBench הוא מפגר אחרי מתחרים ישירים כמו Qwen-14B, כך שעיקר הכוח שלו נשאר בכתיבה, הבנת טקסט ורב-לשוניות אסייתית.

מתאים ל

  • שירות לקוחות ביפן וקוריאה

    מציג ציונים גבוהים במיוחד בבדיקות שפה ביפנית וקוריאנית, ומאפשר שיחה שוטפת ומקומית ללא שירותי צד שלישי.

  • בוט שיחה כללי מקומי

    קיבל ציון 7.37 במדד MTBench, מה שהופך אותו לפרטנר טוב לשיחות יומיומיות וכתיבה יוצרת באנגלית ובסינית.

  • תרגום טקסטים אסיאתיים

    בסיס האימון המעורב שלו ב־2.5 טריליון טוקנים מתאים במיוחד לעבודה שמשלבת בין אנגלית לסינית, יפנית וקוריאנית.

איפה זה נופל

החיסרון המרכזי כאן הוא חלון ההקשר, שעומד על 4,096 טוקנים בלבד בגרסה הזו. זה קצר מאוד לעבודה עם מסמכים ארוכים, קוד או שיחות מתמשכות, אלא אם פונים לגרסת ה־LongChat הנפרדת. בנוסף, במבחני AlignBench בתחומי מתמטיקה ולוגיקה הוא מציג תוצאות נמוכות יחסית, 4.0 במתמטיקה מול 4.91 ב־Qwen, ולכן לא מומלץ להסתמך עליו למשימות חישוביות או לוגיות מורכבות.

אותה משפחה

Orion יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה בעברית?

לא. המודל אומן בעיקר על אנגלית, סינית, יפנית וקוריאנית, ואין לו שום התאמה מתועדת לעברית. אם תנסו לכתוב לו בעברית תקבלו תוצאות שבורות או הזיות.

איך אפשר להריץ אותו על מחשב אישי רגיל?

המשקל המקורי כבד מדי עבור רוב המחשבים האישיים. הדרך היחידה להריץ אותו מקומית היא להמיר אותו לפורמט GGUF דרך llama.cpp או להוריד את גרסת ה־Int4 המכומתת, שדורשת כ־8.3 גיגה זיכרון בלבד.

איך מריצים

המשקל המלא של הקבצים מגיע ל־54 גיגה בייט בפורמט bfloat16 על פני 31 קבצים נפרדים. כדי להריץ אותו בלי שום כימות תצטרכו כרטיס מסך עם לפחות 32 גיגה זיכרון VRAM, כמו A100 או זוג כרטיסי 3090 או 4090.

יש למודל גרסאות מכומתות ב־4 ביט שמורידות את המשקל לכ־8.3 גיגה בייט, ואפשר להריץ אותן דרך vLLM או llama.cpp על כרטיס ביתי של 12 או 16 גיגה. אם אתם לא חייבים פרטיות מוחלטת או שאין לכם חומרה מתאימה, עדיף להשתמש ב־API של ספק ענן במקום לתחזק שרת כזה.

ollama run hf.co/OrionStarAI/Orion-14B-Chat:Orion-14B-Chat

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הקוד עצמו מפורסם ברישיון Apache 2.0, אבל משקלי המודל כפופים להסכם קהילתי ייעודי של החברה בשם Orion-14B Series Models Community License Agreement. תנאי השימוש המסחריים הספציפיים לא דווחו במלואם בדף, ויש דרישה לאישור רגולטורי לשימוש באינטרנט. לפני שילוב שלו במוצר מסחרי צריך לבדוק את נוסח ההסכם המדויק.

הרישיון המלא בעמוד המודל ↗