تجزیه و تحلیل داده ها و روش های محاسباتی در داده های نظارت بر سلامت عمومی
تجزیه و تحلیل مقطعی روش اشباع نشانگر ضربه ای برای تشخیص پرت تخمین زده شده از طریق تکنیک های منظم سازی با استفاده از داده های COVID-19
خلاصه
اشباع نشانگر ضربه یک روش محبوب برای تشخیص پرت در مدل سازی سری های زمانی است که از کمترین مربع های برش خورده (LTS)، برآوردگر M و برآوردگر MM برتری دارد. با این حال، استفاده از روش IIS برای تشخیص پرت در تحلیل مقطعی ناشناخته باقی مانده است. در این مقاله، امکان سنجی روش IIS را برای داده های مقطعی بررسی می کنیم. در همین حال، ما علاقه مند به پیش بینی عملکرد و انتخاب متغیر کمکی در حضور پرت هستیم. روش IIS از تکنیک های Autometrics برای تخمین متغیرهای کمکی و پرت به عنوان تعداد متغیرهای کمکی استفاده می کند.
مشاهداتعلاوه بر Autometrics، تکنیک های منظم سازی روشی شناخته شده برای انتخاب متغیرهای کمکی و پیش بینی در تحلیل های با ابعاد بالا هستند. با این حال، کارایی تکنیک های منظم سازی برای روش IIS ناشناخته باقی مانده است. برای این منظور، ما کارایی تکنیک های منظم سازی را برای پیش بینی خارج از نمونه در حضور پرت ها با انحراف استاندارد ۶ و ۴ (SD) و متغیرهای کمکی متعامد بررسی می کنیم. نتایج شبیه سازی نشان می دهد که SCAD و MCP در پیش بینی و انتخاب متغیرهای کمکی با 4 SD (20٪ و 5٪ نقاط پرت) در مقایسه با Autometrics عملکرد بهتری دارند. با این حال، LASSO و AdaLASSO متغیرهای کمکی بیشتری نسبت به SCAD و MCP انتخاب می کنند و دارای RMSE بالاتری هستند. به طور کلی، تکنیک های منظم سازی کمترین RMSE را نسبت به Autometrics دارند، زیرا Autometrics دارای کمترین میانگین سنج با هزینه کمترین میانگین قدرت است. ما از داده های مقطعی COVID-19 جمع آوری شده از 1 ژوئیه 2021 تا 30 سپتامبر 2021 برای تجزیه و تحلیل داده های واقعی استفاده می کنیم. SCAD و MCP سطح CRP، جنسیت و سایر بیماری های همراه را به عنوان پیش بینی کننده مهم اقامت در بیمارستان با کمترین RMSE خارج از نمونه به ترتیب 7. 45 و 7. 50 انتخاب می کنند.
1. معرفی
روش حداقل مربعات معمولی (OLS) یک تکنیک به طور گسترده ای در میان روش های موجود در تحلیل رگرسیون انتخاب شده است، زیرا از نظر محاسباتی ساده است و بهترین تخمین بی طرفانه خطی را دارد. با این حال، دارای مفروضات قوی در مورد توزیع خطا (
) ، که معمولاً هنگام برخورد با تجزیه و تحلیل داده های واقعی نقض می شود. علت اصلی اعوجاج Outiers است که فرض عادی بودن باقیمانده ها را نقض می کند. داده های دور افتاده در متغیرهای وابسته و رگرسیونر خطر برای رگرسیون حداقل مربعات را ایجاد می کنند زیرا در صورت عدم گزارش ممکن است بر تخمین تأثیر منفی بگذارد. حتی داده های مقطعی با کیفیت بالا حاوی فضای باز است. با این حال ، در داده های اقتصادی سری زمانی نادر است (به دلیل متغیرهای متفاوت) [1].
از تکنیک های رگرسیون قوی در ادبیات نمایش های دورتر استفاده می شود. لانگفورد و لوئیس [2] به خوبی به عنوان نقاط داده ای که با بقیه داده ها متناقض به نظر می رسند ، به خوبی تعریف کردند. چنین نقاط تأثیرگذار غالباً از کاربر پنهان می شوند زیرا همیشه در نمودار باقیمانده حداقل مربعات استاندارد ظاهر نمی شوند [3]. زامان و همکاران.[1] نشان می دهد که باقیمانده های OLS در پیدا کردن دور در اندازه های نمونه کوچک و بزرگ ناکارآمد هستند ، در حالی که Rousseeuw و Leroy [4] چندین مجموعه داده واقعی را نشان می دهند که در آن باقیمانده های OLS با وجود مسافت های قابل توجه ، هرگونه دور را تشخیص می دهند. با این حال ، رویه های آماری جدید ارائه شده است که کمتر مستعد ابتلا به خارج از کشور هستند. Rousseeuw [5] برآوردگرهای اصلی رگرسیون قوی (حداقل مربعات متوسط (LM) ، حداقل مربعات برش خورده (LTS) و تغییرات) را معرفی کرد که حتی در صورت وجود تعداد زیادی از خارج از کشور نیز به درستی انجام می شود. تخمین هوبر M ، برآورد MM ، حداقل روش مقدار مطلق (LAV) و برآورد S نمونه هایی از رویکردهای قوی هستند [6-8]. یک تکنیک آشکار در تخمین های M-Huber ایجاد شده است که در پارامترهای موقعیت مکانی استحکام دارد. متأسفانه ، کلیات مدلهای رگرسیون برای تحقق استحکام نشان می دهد. همانطور که Rousseeuw [5] نشان می دهد ، رگرسیون M-Desitators نیز دارای 0 ٪ ارزش تجزیه است. تعمیم تخمین های MM نیز به همین ترتیب نمی تواند به مقادیر تجزیه بزرگی برسد. یک روش مستقیم برای رگرسیون قوی استفاده از تجزیه و تحلیل LTS در باقیمانده های عظیم است. تجزیه و تحلیل LTS مشاهدات دور افتاده را کنار می گذارد و سپس می تواند یک رگرسیون استاندارد OLS را که در Rousseeuw پیشنهاد شده است ، اجرا کند [5]. با این حال ، حذف بیش از حد داده ها در مورد مشاهدات بیش از حد بیش از حد ، خطر مدل رگرسیون نهایی را نشان نمی دهد که منعکس کننده انجمن است که اقتصاددان می خواهد ارزیابی کند [1].
در مقابل ، Dooik [9] و Johansen و Nielsen [10] اشباع نشانگر Impulse (IIS) را به عنوان یک برآوردگر قوی نشان می دهند. به طور مشابه ، یوهانسن و نیلسن [10] توصیف می کنند و نشان می دهند که یک برآوردگر نمونه تقسیم شده برای مدل رگرسیون اشباع نشانگر یک تخمین M-Step است که دو بار تکرار می شود. Dooik [9] نشان می دهد که حداقل مربعات قوی و اشباع شاخص از حداقل مربعات بریده شده کارآمدتر هستند. هنگامی که متغیرهای متغیر استاتیک هستند و فقط در خارج از کشور در داده های متغیر وابسته اتفاق می افتد ، تخمین M به طور مؤثر کار می کند. روش اشباع نشانگر Impulse در ابتدا برای تشخیص تعداد ناشناس از مسافت های دور با بزرگی نامشخص در نقاط نامشخص در نمونه ، همراه با شروع و پایان مشاهدات طراحی شده است [11]. با این حال ، روش اشباع نشانگر مرحله (SIS) یک نسخه اصلاح شده از تکنیک های IIS برای تشخیص چند شکست است. اشباع شاخص (IS) به عنوان یک اصطلاح مرزی استفاده می شود که از راه دور (از طریق IIS) و تغییر چند شکست (از طریق SIS) استفاده می کند و همزمان مدل سازی زیرین را تخمین می زند [9-13].
از آنجا که روش IS بیش از تعداد نقاط داده ، تعداد کاندیداها را رگرسیون می کند ، تخمین های OLS نتوانسته است مدل پر رونق را تخمین بزند. با این حال ، اتوماتیک بدون در نظر گرفتن رأی دهندگان کاندیدایی که بیش از تعداد مشاهدات است ، چنین پدیده هایی را به طور موثر انجام می دهد. به همین دلیل ، روش IS برای تخمین از طریق اتوماتیک امکان پذیر است. Autometrics از الگوریتم های گسترش و پیمانکاری چند مسیر با سطح اهمیت مشخص شده توسط کاربر از طریق فرآیند انتخاب مدل استفاده می کند. با این حال ، انتخاب سطح اهمیت ، تجارت بین شاخص های ساختگی بی ربط و مربوطه یا رگرسیون است ، با سطح معنی داری (0. 001) متغیر قابل توجهی که در مدل نهایی حذف شده است ، در حالی که ، با 0. 05 سطح اهمیت ، مدل از رگرسیونرهای بی ربط تشکیل شده است.[13-15].
به غیر از اتومبیل ، تکنیک های منظم در حال ظهور هستند که تعداد متغیرهای متغیرهای متغیر از تعداد نقاط داده (مشاهدات) برتری دارند. برخی از این تکنیک های محبوب حداقل اپراتور انتخاب زیر مجموعه (Lasso) ، لاسو تطبیقی ، انحراف مطلق (SCAD) و مجازات مقعر Minimax (MCP) هستند [16-19]. با این حال ، هر چند مطالعه ، راندمان محاسباتی خودروزی را با تکنیک های منظم [20] [21-23] برای انتخاب و پیش بینی متغیر با فرض عادی مقایسه می کنند. آنها با راه اندازی IIS Outliers را در نظر نمی گیرند. از آنجا که انتخاب سطح اهمیت برای مدل های پر رونق در خودروزی چالش برانگیز است ، می توان از تکنیک های منظم به عنوان یک روش انتخاب مدل جایگزین در این مورد استفاده کرد. به روز ، مطالعات غالب ، راندمان محاسباتی تکنیک های منظم را با خودروزی در تجزیه و تحلیل مقطعی با Outler در تنظیم IIS مقایسه نمی کنند. این مطالعه با هدف تجزیه و تحلیل بهره وری محاسباتی تکنیک های تنظیم با تنظیم IIS در پدیده های مقطعی انجام شده است. مهارت محاسباتی این روشها با قدرت ، سنج و ریشه خارج از نمونه خطای مربع (RMSE) در آزمایش شبیه سازی ارزیابی می شود. برای آزمایش شبیه سازی ، فرآیند تولید داده ها (DGP) ، ما با رگرسیونرهای متعامد انتخاب می کنیم و سه سناریو 5 ٪ ، 10 ٪ و 20 ٪ مشاهدات خارج از کشور را با 4 و 6 انحراف استاندارد (SD) داریم. در همین حال ، در DGP ، ما موارد متعامد را برای این منظور از برخی تکنیک های ارتوگونی شناخته شده مانند لاسو ، لاسو تطبیقی ، انحراف مطلق (SCAD) و مجازات مقعر مینیماکس (MCP) استفاده می کنیم. [16-19].
تشخیص دورافتاده روشی به سرعت در حال توسعه در صنایع مراقبت های بهداشتی و داده های پزشکی است و منبع مهمی از نگرانی است. Hauskrecht و همکاران.[24] سیستم نظارتی مبتنی بر داده های مبتنی بر داده محور را که از داده های موارد قبلی بیمار استفاده می کند ، مطالعه کنید. ویلسون و همکاران.[25] از روش شناسایی دورافتاده برای ایمنی هیپوگلیسمی در بیماران استفاده کرد ، و در حالی که در نظر می گیرد نسبت به جمعیت خطرناک ، یک ارزش دورتر از استعداد را در طی یک سال محاسبه می کند ، محاسبه می کند. جیوتی و همکاران.[26] در داده های مراقبت های بهداشتی ، منبع اصلی نگرانی برای بیمه گذاران بهداشتی ، از تشخیص دورتر استفاده کرد. توسعه یک رویکرد تشخیصی بیش از حد تحت نظارت در ادعاهای مراقبت های بهداشتی (SODAC) و در دو بخش انجام می شود. نوما و همکاران.[27] اقدامات بهینه را برای مدل های متاآنالیز شبکه با نتایج گمراه کننده و درجه مناسب تنظیم آزادی ارائه می دهد. کاربرد داده های واقعی روش IIS در مراقبت های بهداشتی و پزشکی با محیط زیست برای تجزیه و تحلیل مقطعی در ادبیات فعلی وجود ندارد [24-30]. برای بررسی اثربخشی روش IIS که از طریق تکنیک های تنظیم شده برای تکنیک های داده واقعی تخمین زده می شود ، ما از داده های نظارتی مقطعی COVID-19 استفاده می کنیم ، که از ژوئیه 2021 تا 30 سپتامبر 2021 در بیمارستان جداسازی و مرکز درمانی عفونی (IHITC) اسلام آباد جمع آوری شده است. بشرهدف ما تجزیه و تحلیل عوامل مرتبط با طولانی شدن مدت زمان اقامت در بیمارستان از بیماران Covid-19 در قلمرو پایتخت اسلام آباد است.
2. تکنیک های تشخیص و انتخاب مدل
2. 1اشباع نشانگر Impulse
اشباع نشانگر Impulse یک روش محبوب برای تشخیص دورتر است زیرا در حال حاضر بر تکنیک های انتخابی دورتر موجود مانند حداقل مربعات بریده شده (LTS) ، M-Desitator و MM-Desitimator حاکم است [9 ، 10]. معمولاً ، در رگرسیون چند متغیره ، فرض می کنیم که خطا به طور عادی توزیع می شود ، که معمولاً در تجزیه و تحلیل داده های واقعی نقض می شود. در معادله زیر فرض می کنیم که خطا به طور معمول بی اعتماد نیست ، و
خبرهای فارکس...
ما را در سایت خبرهای فارکس دنبال می کنید
برچسب :
نویسنده : شهره لرستانی
بازدید : <-PostHit->
تاريخ : جمعه
9 تير
1402 ساعت: 16:36