گراف دانش پزشکی

استخراج خودکار مفاهیم و روابط پزشکی از متون علمی و پاسخ به پرسش‌های تخصصی با کمک گراف دانش.

سلامت
پردازش زبان طبیعیگراف دانشمدل‌های زبانیپایتون

هر روز هزاران مقاله و گزارش پزشکی منتشر می‌شود و هیچ پزشک یا پژوهشگری نمی‌تواند همهٔ آن‌ها را بخواند. در این پروژه سامانه‌ای ساختیم که این متون را می‌خواند، مفاهیم پزشکی (بیماری، علامت، دارو، ژن و آزمایش) را از آن‌ها بیرون می‌کشد و روابط میان آن‌ها را در یک «گراف دانش» نگه می‌دارد تا بتوان با یک پرسش ساده به دانش پراکندهٔ صدها منبع دسترسی داشت.

مسئله

دانش پزشکی در قالب متن آزاد نوشته می‌شود: مقاله، کتاب مرجع، راهنمای بالینی و گزارش. جست‌وجوی کلیدواژه‌ای در این متون فقط سندها را پیدا می‌کند، نه پاسخ را؛ و اینکه «کدام داروها برای این بیماری استفاده می‌شوند و چه تداخل‌هایی دارند» با چند جست‌وجو و ساعت‌ها خواندن به دست می‌آید. افزون بر این، متون فارسی و انگلیسی با اصطلاحات و مترادف‌های گوناگون نوشته می‌شوند و یک مفهوم با چند نام ظاهر می‌شود.

راهکار ما

یک خط پردازش متن ساختیم که اسناد را دریافت و پاک‌سازی می‌کند، با مدل‌های پردازش زبان طبیعی موجودیت‌های پزشکی را تشخیص می‌دهد، نام‌های مختلف یک مفهوم را به یک شناسهٔ واحد نگاشت می‌کند و رابطه‌هایی مثل «درمان می‌کند»، «علامتِ … است» و «تداخل دارد با» را استخراج می‌کند. نتیجه در یک پایگاه دادهٔ گرافی ذخیره می‌شود و روی آن لایهٔ پرسش‌وپاسخ با مدل زبانی قرار گرفت که پاسخ را فقط از روی دانش گراف و با ذکر منبع می‌سازد.

سامانه چطور کار می‌کند

  1. ۱
    گردآوری منابع

    مقالات، کتاب‌های مرجع و متون بالینی از منابع مجاز جمع‌آوری و به متن ساخت‌یافته تبدیل می‌شوند.

  2. ۲
    تشخیص مفاهیم

    مدل‌های زبانی آموزش‌دیده روی متون پزشکی، بیماری‌ها، علائم، داروها، ژن‌ها و آزمایش‌ها را در متن پیدا می‌کنند.

  3. ۳
    یکسان‌سازی

    مترادف‌ها، اختصارها و معادل‌های فارسی و انگلیسی به یک مفهوم واحد نگاشت می‌شوند تا دانش تکراری و پراکنده نشود.

  4. ۴
    استخراج روابط

    رابطه‌های معنادار میان مفاهیم همراه با جملهٔ منبع و میزان اطمینان استخراج می‌شوند.

  5. ۵
    ساخت گراف

    مفاهیم گره‌ها و روابط یال‌های گراف می‌شوند؛ هر یال به منبعی که از آن آمده پیوند دارد.

  6. ۶
    پرسش‌وپاسخ

    کاربر به زبان طبیعی می‌پرسد؛ سامانه زیرگراف مرتبط را پیدا می‌کند و مدل زبانی پاسخ را با ارجاع به منابع می‌نویسد.

قابلیت‌های اصلی

  • جست‌وجوی معنایی به‌جای جست‌وجوی کلیدواژه‌ای
  • نمایش بصری روابط بیماری، علامت، دارو و ژن
  • ارجاع هر پاسخ به جمله و منبع اصلی برای بررسی کارشناس
  • پشتیبانی از متون فارسی و انگلیسی
  • به‌روزرسانی تدریجی گراف با ورود منابع جدید
  • امکان افزودن دانش داخلی سازمان (دستورالعمل‌ها و پروتکل‌ها)

مناسب برای

  • مراکز پژوهشی و دانشگاه‌های علوم پزشکی
  • شرکت‌های دارویی و تجهیزات پزشکی
  • بیمارستان‌ها برای دسترسی سریع به پروتکل‌ها
  • سامانه‌های سلامت دیجیتال

نقش آساراد در پروژه

  • تحلیل نیاز و تعریف مدل داده (هستی‌شناسی پزشکی)
  • آماده‌سازی داده و برچسب‌گذاری نمونه‌ها
  • ساخت و تنظیم مدل‌های تشخیص مفهوم و رابطه
  • طراحی گراف و لایهٔ پرسش‌وپاسخ
  • استقرار و تحویل مستندات

نتیجه

به‌جای چند ساعت جست‌وجو و خواندن، کارشناس در چند ثانیه پاسخی مستند با منبع می‌گیرد و می‌تواند مسیر روابط را روی گراف ببیند و درستی آن را بسنجد. همین زیرساخت پایهٔ سامانهٔ پاسخ‌گویی پزشکی ما هم شد.

این سامانه ابزار کمکی برای متخصصان است و جای تشخیص و تصمیم پزشک را نمی‌گیرد.

پروژه‌ای شبیه این دارید؟

با یک جلسهٔ مشاوره یا گزارش امکان‌سنجی شروع کنید تا مسیر، زمان و هزینهٔ اجرای آن در سازمان شما روشن شود.

پروژه‌های دیگر