GPT
H

Hulu-Med-7B

קוד פתוח

ZJU-AI4Hapache-2.02025-10-09

  • transformers
  • safetensors
  • hulumed_qwen2
  • text-generation
  • medical

מודל שפה וחזון רפואי בקוד פתוח שמנתח צילומי רנטגן, MRI תלת־ממדי וסרטוני ניתוח. מתאים למי שרוצה ביצועים קליניים טובים על שרת מקומי בלי להוציא מידע רפואי רגיש החוצה.

  • 8Bפרמטרים
  • 32,768טוקנים בהקשר
  • 15.0 GBמשקל הקבצים
  • 3,589הורדות בחודש

מה זה

המודל הזה בנוי על בסיס Qwen2.5-7B יחד עם מקודד תמונה SigLIP, ועבר אימון על 16.7 מיליון דוגמאות מ־14 תחומי הדמיה רפואית, מ־CT ועד פתולוגיה. השילוב הזה נותן לו יכולת לעבד טקסט קליני, תמונות דו־ממדיות, נפחים תלת־ממדיים בקובצי NIfTI וסרטוני ניתוח באותה תשתית, עם חלון הקשר של 32,768 טוקנים וצמצום של כ־55 אחוז בכמות הטוקנים הוויזואליים כדי לשמור על מהירות.

במדדי ראייה רפואית מתחת ל־10 מיליארד פרמטרים הוא מוביל כרגע. בבנצ'מרקים כמו OM.VQA ו־PMC-VQA הוא קיבל 84.2 ו־66.8, ועקף מודלים ייעודיים כמו Lingshu-7B ו־HuatuoGPT-V-7B. במבחני טקסט רפואי כמו MedQA הוא עומד על 73.5, שזה יפה לקטגוריה שלו, אבל עדיין משאיר פער ברור מול מודלים מסחריים סגורים כמו Claude Sonnet 4 שמגיעים שם ליותר מ־90.

מתאים ל

  • פענוח ראשוני לסריקות 3D

    קריאת קובצי NIfTI והפקת טיוטת דוח על בסיס סריקות CT או MRI.

  • ניתוח שלבי ניתוח בווידאו

    זיהוי שלבים ואירועים ברצף וידאו מחדרי ניתוח לצורכי תיעוד והדרכה.

  • שאלות ותשובות על ספרות

    מענה על שאלות רפואיות מורכבות מתוך מאמרים תוך שמירה על המידע מקומית.

איפה זה נופל

למרות השליטה במינוחים רפואיים, המודל רחוק מלהחליף עין מקצועית. במבחני הבנה רפואית מורכבים כמו MedXQA הוא מקבל רק 19.6 בטקסט ו־29.0 במבחן הרב־תחומי, מה שמראה שהוא עדיין מנחש וטועה הרבה כשמדובר באבחנות עמוקות. בנוסף, כל האימון שלו נשען על נתונים פומביים באנגלית, כך שאין שום ביסוס שהוא יבין תיקים רפואיים בעברית או מונחים מקומיים של מערכת הבריאות בארץ.

אותה משפחה

Hulu-Med יצא ב־4 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל מבין תוצאות בדיקות ומסמכים בעברית?

האימון נעשה על מקורות מידע רפואיים גלובליים באנגלית, ולכן היכולת שלו לנתח מסמכים בעברית מוגבלת מאוד. אם הממשק או התיקים הרפואיים שלכם בעברית, תצטרכו לתרגם את המידע לאנגלית לפני השליחה למודל או לאמן אותו ייעודית.

במה הוא שונה ממודל ראייה כללי כמו Qwen2.5-VL?

מודל ראייה כללי מכיר תמונות יומיומיות, אבל נכשל בזיהוי של רקמות, הדמיות CT ומינוחים אנטומיים מדויקים. המודל הזה אומן על 14 סוגי הדמיות רפואיות שונות וכולל התאמה מובנית לקריאת נפחים תלת־ממדיים ישירות, מה שלא קיים במודלים כלליים.

איך מריצים

המשקלים בפורמט bfloat16 שוקלים 15 גיגהבייט. כדי להריץ אותו כמו שצריך יחד עם חלון הקשר סביר ועיבוד תמונות, תצטרכו כרטיס מסך יחיד עם לפחות 24GB זיכרון VRAM, כמו RTX 3090, RTX 4090 או כרטיס שרת מקביל כמו A10. הוא נטען ישירות דרך Transformers עם trust_remote_code=True, ויש לו גם תמיכה בהרצה מהירה דרך גרסת vLLM מותאמת.

אם אתם צריכים רק לענות על שאלות טקסט כלליות בלי לנתח הדמיות כבדות, מודל 4B הקטן יותר בסדרה יעשה עבודה טובה על חומרה חלשה בהרבה. לעומת זאת, אם המטרה היא ניתוח מורכב ברמת דיוק מקסימלית ואין לכם מגבלת פרטיות מחמירה, פנייה ל־API של מודל ענן סגור תיתן תוצאות עקביות יותר בלי לתחזק שרת.

from transformers import pipeline

pipe = pipeline("image-text-to-text", model="ZJU-AI4H/Hulu-Med-7B")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והפצה של המודל בתוך מוצרים סגורים. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗