GPT
A

AntAngelMed

קוד פתוח

MedAIBaseapache-2.02025-12-12

  • safetensors
  • bailing_moe
  • custom_code

מודל שפה רפואי ענק שמתמקד בהסקה קלינית ובשיחות רופא מול מטופל. הוא מיועד למי שרוצה ביצועים ברמה גבוהה במדדים רפואיים, אבל צריך קצב יצירת טוקנים מהיר יחסית לגודל כזה.

  • 103Bפרמטרים
  • 32,768טוקנים בהקשר
  • 192 GBמשקל הקבצים
  • 74הורדות בחודש

מה זה

הבסיס כאן הוא ארכיטקטורת תערובת מומחים עם 103 מיליארד פרמטרים בסך הכול, אך בכל פעולת חישוב מופעלים רק 6.1 מיליארד מתוכם. השילוב הזה נותן כושר ביטוי של מודל עמוק בהרבה בלי לשלם בזמן עיבוד איטי, ובחומרה מסוימת הוא מייצר מעל 200 טוקנים בשנייה. תהליך האימון שלו כלל הרחבה על טקסטים ומאמרים רפואיים, כוונון להוראות קליניות, וחיזוק בהתנהגות מול מטופל בעזרת אלגוריתם ייעודי.

במבחני ביצועים הוא עוקף מודלים פתוחים אחרים בבנצ'מרקים ייעודיים לתחום הבריאות כמו HealthBench של אופנאיי, ומחזיק במקומות הראשונים במבחנים סיניים מקיפים כמו MedBench ו־MedAIBench. המשמעות בשטח היא פחות הזיות בתשובות מורכבות, הבנה מדויקת של שיחות אבחון מרובות שלבים, ויכולת לשמור על גבולות אתיים ובטיחותיים בזמן ניתוח מקרים קשים.

מתאים ל

  • סימולציות אבחון מורכבות

    ניתוח מקרים קליניים מרובי שלבים בזכות דיוק גבוה במבחני HealthBench-Hard.

  • בוט רפואי ברשת סגורה

    מענה לשאלות מטופלים בלי להוציא מידע רגיש מהשרת המקומי של הארגון.

  • שרת הסקה בנפח גבוה

    הפעלת שירות רפואי מהיר שמנצל את ההפעלה החלקית של 6 מיליארד פרמטרים.

איפה זה נופל

חלק ניכר מתהליך ההערכה שלו נשען על מבחנים סיניים כמו MedBench ו־MedAIBench, כך שהמומחיות שלו מוטה בבירור למונחים, לפרקטיקות ולשפות שבהן אומן. אין שום תיעוד או בדיקה לגבי תפקוד בשפה העברית, ולכן אסור להסתמך עליו לניתוח תיקים מקומיים בלי בדיקת שפיות מקיפה. בנוסף, חלון ההקשר הבסיסי עומד על כ־32 אלף טוקנים והגעה לטווח של 128 אלף נשענת על אקסטרפולציה, מה שעלול לפגוע ביציבות כשמעמיסים היסטוריה רפואית ארוכה מדי.

שאלות
נפוצות

האם המודל תומך בעברית לשימוש במרפאה בארץ?

הוא לא אומן או נבדק על דאטה רפואי ישראלי, והאימונים התמקדו באנגלית ובסינית. אפשר לתשאל אותו, אבל המונחים וההנחיות הקליניות לא יתאימו לרגולציה מקומית בלי כוונון עצמאי.

כמה כרטיסי מסך חייבים כדי להרים אותו?

בדיוק מלא תצטרכו לפחות ארבעה כרטיסים של 96 גיגה בייט או שמונה כרטיסים של 64 גיגה בייט. גרסת ה־INT4 חוסכת משאבים ויכולה לרוץ על כרטיס בודד של 96 גיגה בייט.

למה שהמודל ירוץ מהר אם יש לו מאה מיליארד פרמטרים?

בגלל ארכיטקטורת המומחים שלו, שבה כל טוקן מפעיל רק 6.1 מיליארד פרמטרים בפועל. החישוב עצמו קל מאוד פר מילה, אך עדיין חובה להחזיק את כל הזיכרון של המודל טעון מראש.

איך מריצים

כדי להריץ את גרסת המקור בדיוק המלא צריך 192 גיגה בייט פנויים רק בשביל המשקלים, מה שמחייב שרת של שמונה מאיצי Ascend 910B או ארבעה כרטיסי A100 עם מקביליות טנזורים של ארבעה לפחות. מנועי הסקה כמו vLLM או SGLang מריצים אותו ישירות ופותחים שרת תואם אופנאיי, אך דורשים הרצת קוד מרוחק כדי לטעון את הארכיטקטורה התואמת ל־Ling.

אם אין לכם קלאסטר כזה בענן, עדיף להוריד את גרסאות ה־FP8 או ה־INT4 שדורשות הרבה פחות זיכרון, או פשוט לגשת ל־API הניסיוני שהמפתחים פרסמו. להרים שרת עצמאי עם 35 קבצי משקל שווה את המאמץ רק עבור חברות שמחויבות לשמור נתונים רפואיים בתוך רשת סגורה.

pip install -U huggingface_hub
hf download MedAIBase/AntAngelMed

הרישיון

המטא דאטה מציין רישיון Apache 2.0 שמתיר שימוש מסחרי חופשי, הפצה ושינוי קוד, אך בעמוד עצמו מפנים לקוד מקור תחת רישיון MIT. בשני המקרים מותר לשלב את המשקלים במוצרים מסחריים בלי תמלוגים, כל עוד מצרפים את תנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗