GPT
B

bioclip-2

קוד פתוח

imageomicsmit2025-05-27

  • open_clip
  • safetensors
  • biology
  • CV
  • images

מודל תשתית ביולוגי שמזהה זנים בתמונות בדיוק מרשים, ומבוסס על אימון של כמאתיים מיליון פריטים. הוא מתאים למי שצריך חילוץ מאפיינים וסיווג טקסונומי באפס דוגמאות מראש.

  • 3.2 GBמשקל הקבצים
  • 101,284הורדות בחודש
  • 38לייקים

מה זה

הארכיטקטורה יושבת על ViT-L/14 של CLIP שאומן מחדש על מאגר TreeOfLife-200M, שמכיל כמעט 214 מיליון תמונות וקרוב למיליון טקסונים, בשילוב תת-קבוצה של LAION-2B למניעת שכחה. המטרה כאן היא לתת מענה לתמונות של אורגניזמים, חיות, צמחים ופטריות, בלי להסתמך על מודלי ראייה כלליים שמתקשים בהבדלים ביולוגיים דקים.

במבחני סיווג זנים באפס דוגמאות, הוא הגיע לממוצע של 55.6% בדיוק מול 37.6% של BioCLIP המקורי ו־25.5% של CLIP הבסיסי. בפטריות הוא קופץ מ־40.9% בגרסה הקודמת ל־83.8%, ובזנים נדירים הוא מזנק ל־76.8%. במשימות ביולוגיות רחבות יותר, כמו סיווג תכונות ב־AwA2 או גילוי זנים חדשים ב־Herbarium19, הוא השיג ממוצע של 57.5%, ועקף מודלים כמו DINOv2 שעמד על 47.3%.

מתאים ל

  • זיהוי חיות במצלמות שביל

    משיג 53.9% במבחן מצלמות שביל, פי 1.7 מהגרסה הקודמת, ומתאים למיון מהיר של צילומי טבע.

  • סיווג צמחים ופטריות

    מדייק ב־96.8% על PlantNet ו־83.8% על פטריות, ומספק תוצאות חזקות באפס דוגמאות מראש.

  • מקודד מאפיינים למחקר ביולוגי

    מייצר וקטורים איכותיים למשימות כמו חלוקת תכונות ומציאת זנים לא מוכרים במערכי נתונים.

איפה זה נופל

הנתונים שעליהם הוא אומן סובלים מחוסר איזון מובנה של התפלגות זנב ארוך, ולכן המודל נוטה בבירור לטובת מינים שנפוצים במאגר. אם אתם בונים מערכת לזיהוי פלנקטון, אל תבנו עליו, במבחן של Meta-Album הוא קיבל רק 3.9% דיוק, נמוך אפילו מ־6.1% של הגרסה הקודמת. הוא גם תומך באנגלית בלבד לשמות הטקסונומיים, כך שסיווג עם שמות בעברית ידרוש תרגום מראש. בנוסף, הוא מקבל רק תמונות של 224 על 224, מה שעלול לפגוע בזיהוי פרטים זעירים.

שאלות
נפוצות

האם אפשר להריץ שאילתות וטקסונומיה בעברית?

לא ישירות. המודל אומן על טקסט באנגלית, בעיקר שמות מדעיים ושמות עממיים לועזיים. כדי לקבל תוצאות מדויקות, תצטרכו לתרגם את השמות הטקסונומיים לאנגלית או להשתמש בשם המדעי הלטיני לפני שמעבירים אותם לטוקנייזר.

כמה כוח מחשוב דרוש כדי לעבוד איתו במוצר?

המודל שוקל 3.2 גיגה-בייט ומבוסס על ViT-L/14, כך שכרטיס מסך בסיסי יחסית עם 8 גיגה זיכרון יספיק לחלוטין להסקה שוטפת. האימון המקורי דרש 32 כרטיסי H100, אבל להרצה מקומית או לחילוץ מאפיינים לא תצטרכו חומרה חריגה.

איך מריצים

טוענים את המשקלים דרך ספריית open_clip בפייתון באמצעות זיהוי המאגר imageomics/bioclip-2, יחד עם הטרנספורמציות של התמונות והטוקנייזר. הקבצים שוקלים 3.2 גיגה-בייט, כך שכל כרטיס מסך מודרני עם 8 עד 12 גיגה זיכרון יריץ אותו בקלות בהסקה, במיוחד בפורמט bf16 שבו הוא אומן.

התמונות עוברות שינוי גודל לרזולוציה של 224 על 224 פיקסלים לפני הכניסה למקודד. אם אתם צריכים רק תיוג נקודתי של תמונות בודדות ולא רוצים להחזיק שרת דולק, יש למפתחים דמו בחינם ב־Hugging Face Spaces, אבל לצינור עיבוד נתונים אוטומטי עדיף בהרבה להוריד את המשקלים ולהריץ מקומית.

pip install -U huggingface_hub
hf download imageomics/bioclip-2

הרישיון

המודל שוחרר תחת רישיון MIT. מותר להשתמש בו לצרכים מסחריים ופרטיים, לשנות את הקוד והמשקלים, לשלב אותו במוצר סגור ולהפיץ אותו הלאה, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗