GPT
D

DeepSeek-OCR-DEMO

רץ בדפדפן

khang119966mit2025-10-20

  • gradio

הדגמה בדפדפן לחילוץ טקסט מתמונות של מסמכים וזיהוי אובייקטים. היא מתאימה למי שרוצה לבדוק את היכולות של המודל deepseek-ai/DeepSeek-OCR בלי להתקין סביבת פיתוח.

  • הורדות בחודש
  • 453לייקים

מה זה

הכלי מקבל תמונה ישירות מהמחשב או מלוח ההעתקה, ומחזיר טקסט מפוענח לצד תמונה עם סימונים במקרים הרלוונטיים. מאחורי הקלעים רץ המודל DeepSeek-OCR בעזרת ספריית transformers, עם אפשרות לבחור בין חמש רמות רזולוציה שונות, מ־Tiny בגודל 512 על 512 שמיועדת למהירות ועד Large בגודל 1280 על 1280 לאיכות מרבית.

ברירת המחדל המומלצת למסמכים היא Gundam שמשתמשת בחיתוך מותאם. הממשק מאפשר לבצע ארבע משימות שונות: חילוץ טקסט חופשי, המרת מסמך לפורמט Markdown, ניתוח תרשימים וגרפים, ואיתור אלמנטים בתמונה לפי טקסט חופשי שמזינים ידנית.

מתאים ל

  • המרת מסמכים ל־Markdown

    מעלים צילום של עמוד טקסט ומקבלים פלט מובנה בפורמט Markdown שמתאים להעתקה ישירה.

  • ניתוח גרפים ותרשימים

    הזנת תמונות של דיאגרמות או איורים כדי לחלץ את הנתונים והטקסט שנמצאים בתוכם.

  • איתור אלמנטים לפי טקסט

    הקלדת ביטוי חיפוש וקבלת התמונה עם סימון מיקום האובייקט שזוהה בה.

איפה זה נופל

הכלי מוגבל לקובצי תמונה בלבד ואינו מקבל קובצי PDF מרובי עמודים באופן ישיר, כך שמסמכים ארוכים מחייבים פירוק מראש לתמונות נפרדות. בנוסף, משימת איתור האובייקטים דורשת הזנת טקסט חיפוש מדויק כדי להחזיר תמונה מסומנת. אם תנסו להריץ אותה בלי טקסט כזה, התהליך פשוט ייעצר ולא תקבלו תוצאה.

שאלות
נפוצות

האם השימוש בהדגמה כרוך בתשלום?

השימוש בדפדפן פתוח וחינמי לגמרי ואינו דורש הזנת פרטי אשראי או יצירת חשבון. המשאבים מוקצים על גבי חומרת ענן שיתופית, ולכן השירות נגיש לכל מי שנכנס לעמוד.

מה קורה לתמונות שמועלות לממשק?

הקבצים נשלחים לעיבוד על שרת מרוחק ומשתמשים בספריות זמניות כדי להפיק את התוצאה. מכיוון שמדובר בסביבה פתוחה ברשת, מומלץ להימנע מהעלאת מידע אישי, נתונים עסקיים רגישים או מסמכים חסויים.

כמה זמן לוקח לכל עיבוד להסתיים?

ברוב המקרים הפעולה לוקחת מספר שניות בודדות הודות למאיץ הגרפי A10G שמבצע את החישוב. עם זאת, בחירה ברזולוציה גבוהה יותר כמו Large או עומס של משתמשים אחרים עשויים להאריך מעט את זמן ההמתנה.

במה הממשק הזה שונה מהרצת המודל עצמו?

הממשק מציג שכבת Gradio גרפית ונוחה לבדיקה מהירה, אך הוא מוגבל לאפשרויות שהוגדרו בו מראש בתפריטים. מי שמוריד את משקלי המודל ומריץ אותם מקומית מקבל שליטה מלאה בפרמטרים ויכולת לשלב אותו בצנרת עיבוד אוטומטית.

איך משתמשים

טוענים תמונה, בוחרים את גודל הרזולוציה ואת סוג המשימה מתוך התפריטים, ולוחצים על כפתור העיבוד. אם בחרתם במשימת האיתור, יופיע שדה נוסף שבו חובה להקליד את הטקסט שרוצים למצוא, אחרת המערכת תקפיץ שגיאה ולא תמשיך.

אין כאן צורך בהרשמה או בהתחברות כדי להתחיל לעבוד. ההרצה מבוססת על תשתית ZeroGPU עם חומרת A10G, מה שאומר שהעיבוד עצמו רץ מהר למדי על כרטיס גרפי, אבל עשוי להיות תור קצר אם משתמשים נוספים פונים לשרת באותו הרגע.

הרישיון

הקוד של האפליקציה מפורסם תחת רישיון MIT שמאפשר שימוש חופשי ובנייה על גביו. התמונות שאתם מעלים נשלחות לשרת לצורך העיבוד, ולכן לא מומלץ להעלות מסמכים מסווגים או מידע אישי ורגיש לסביבה הציבורית הזו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗