مدلهای خطی عمومی (GLM) در JASP

ساخت وبلاگ

مدتی طول کشید ، اما سرانجام ، مدل خطی تعمیم یافته مکرر (GLM) به عنوان بخشی از ماژول رگرسیون در JASP در دسترس قرار گرفته است! در این پست وبلاگ ، ما یک معرفی سریع در مورد ایده پشت GLM و عملکرد کامل این زیر ماژول جدید JASP را به شما ارائه می دهیم. ما همچنین به شما نشان می دهیم که چگونه می توانید با استفاده از این زیر ماژول GLM ، تجزیه و تحلیل رگرسیون دوتایی را انجام دهید. سرانجام ، ما در مورد برخی از ویژگی های احتمالی آینده بحث می کنیم.

مدلهای خطی تعمیم یافته

یک مدل خطی عمومی (GLM) یک پسوند انعطاف پذیر از رگرسیون خطی معمولی است. GLM که به طور گسترده استفاده می شود ، رگرسیون لجستیک باینری است که مدت هاست به عنوان یک ماژول مستقل در JASP در دسترس بوده است.

به طور کلی ، یک GLM از یک مؤلفه تصادفی و یک مؤلفه سیستماتیک تشکیل شده است:

  • مؤلفه تصادفی توزیع احتمال مناسب را برای متغیر پاسخ مشخص می کند. به عنوان مثال ، توزیع دوتایی برای مدل سازی نسبت ها مناسب است. در رگرسیون خطی معمولی ، از توزیع گاوسی استفاده می شود.
  • مؤلفه سیستماتیک نحوه ارتباط متغیرهای توضیحی با میانگین پاسخ را مشخص می کند. به عنوان مثال ، در رگرسیون لجستیک باینری ، از عملکرد Logit Link برای نقشه برداری پاسخ ها (یعنی احتمالات) به ترکیب خطی پیش بینی کننده ها (یعنی پیش بینی خطی) استفاده می شود. در رگرسیون خطی معمولی ، عملکرد پیوند عملکرد هویت است.

در زیر یک جدول مشاهده کنید که انواع داده های پاسخ را نشان می دهد که زیر ماژول GLM می تواند از آن استفاده کند و توزیع های مناسب مربوطه (همچنین خانواده نیز نامیده می شود) و پیوندها. ستاره * عملکرد پیوند متعارف/پیش فرض را برای یک خانواده خاص نشان می دهد.

این توزیع ها/خانواده ها و پیوندها نیز در ماژول فعلی GLM JASP موجود است.

ماژول جدید JASP GLM

می توانید ماژول GLM را در زیر برگه رگرسیون پیدا کنید. توجه داشته باشید که فقط نسخه کلاسیک (a. k. a مکرر) در حال حاضر در دسترس است. با کلیک بر روی دکمه "I" حتماً پرونده راهنما را بررسی کنید. در آنجا ، می توانید اطلاعات بیشتری در مورد آنچه هر عملکرد انجام می دهد ، چه فرضیاتی را باید جستجو کنید و غیره پیدا کنید.

پانل متغیر ورودی

مانند بسیاری از تجزیه و تحلیل های JASP دیگر ، پانل ورودی را پیدا می کنید که در آن می توانید متغیرهای مورد علاقه مدل را مشخص کنید ، از جمله متغیر وابسته (یعنی پاسخ یا نتیجه) ، متغیرهای متغیر (یعنی متغیرهای کمی) و عوامل (یعنی متغیرهای کیفی). علاوه بر این ، می توانید وزنهای مدل را مشخص کنید. شما همچنین باید خانواده (یعنی توزیع برای متغیر پاسخ) و عملکرد پیوند را انتخاب کنید.

مدل

در پانل مدل ، می توانید تصمیم بگیرید که چه شرایط مدل را در مدل تهی شامل می شود ، که مدل مورد علاقه را می توان با آن مقایسه کرد (به عنوان مثال با استفاده از یک آزمون نسبت احتمال). همچنین می توانید انتخاب کنید که آیا این مدل باید یک اصطلاح رهگیری را شامل شود.

آمار

در پانل آمار ، سه جدول امکان پذیر است.

  1. جدول پیش فرض (که همیشه چاپ می شود) که مدل علاقه را در برابر مدل تهی در معیارهای مختلف (به عنوان مثال AIC ، BIC) مقایسه می کند.
  2. جدول FIT MODEL که اطلاعات خوبی را در مورد مدل مورد علاقه مبتنی بر Deviance یا تست های خوب پیرسون ارائه می دهد.
  3. جدول ضرایب که برآورد پارامتر ، خطاهای استاندارد ، آمار آزمون ، مقادیر P و فواصل اطمینان را ارائه می دهد.

علم تشخیص

با استفاده از پانل Diagnostics ، ابزارهای مختلفی برای بررسی فرضیات مدل در دسترس است. به عنوان مثال ، گزینه های مختلفی برای انجام تجزیه و تحلیل های بصری باقیمانده وجود دارد. شما همچنین می توانید از مسافت های بالقوه ، موارد تأثیرگذار و مسائل چند قطبی در مدل بازرسی کنید.

برآورد میانگین حاشیه ای و تجزیه و تحلیل کنتراست

در این پانل ، می توانید وسایل حاشیه ای تخمین زده شده را برای هر پیش بینی کننده مورد علاقه محاسبه کنید. هنگامی که پیش بینی کننده عاملی است ، وسایل حاشیه تخمین زده شده برای تمام سطوح پیش بینی کننده محاسبه می شوند. هنگامی که پیش بینی کننده مداوم است ، می توانید با مشخص کردن تعداد انحرافات استاندارد به میانگین ، سطحی را که در آن میانگین حاشیه تخمین زده می شود ، سفارشی کنید. همچنین می توانید تجزیه و تحلیل کنتراست را انجام دهید تا به عنوان مثال ، دو وسیله حاشیه ای را در یک پیش بینی کننده مقایسه کنید. برای اطلاعات بیشتر در مورد این ، بررسی کنید: https://jasp-stats. org/2020/04/14/the-wonderful-world-of-marginal-means/.

گزینه های پیشرفته

این پانل گزینه ای را برای تنظیم بذر تصادفی به شما می دهد. پیش فرض 1 است. فقط در صورت تمایل به تهیه توطئه ها و جداول قابل تکرار که بر اساس باقیمانده های کمی در بخش Diagnostics است ، یک دانه تصادفی تنظیم کنید. دلیل این امر این است که محاسبه باقیمانده های کمی شامل ترسیم مقادیر تصادفی از توزیع است ، که منجر به مقادیر مختلف باقیمانده های کمی از یک قرعه کشی به دیگری می شود.

آموزش: رگرسیون دوتایی

در این آموزش ، مجموعه داده های توربین ها را در نظر می گیریم ، که مربوط به نسبت چرخ های توربین در حال ایجاد شکاف است. این مجموعه داده را می توان از طریق این لینک بارگیری کرد. همچنین از طریق کتابخانه GLMSDATA در R (Du & Smith ، 2018) در دسترس است. منبع اصلی "وین نلسن (1982) است. داده های زندگی کاربردی ، ویلی ، 407-409. "

سه متغیر مورد علاقه وجود دارد:

  1. نسبت: نسبت چرخ های توربین در حال ایجاد شکاف.
  2. توربین ها: تعداد کل چرخ های توربین.
  3. ساعت ها: تعداد ساعاتی که چرخ توربین اجرا شد.

مشخصات مدل

ایده این است که رابطه بین نسبت چرخ های توربین ایجاد شکاف و تعداد ساعات اجرا را الگوبرداری کنیم. برای انجام این کار ، ابتدا خانواده Binomial را انتخاب می کنیم ، که توزیع مناسبی برای نسبت های مدل سازی است. ما پیوند ورود به سیستم (پیش فرض) را در اینجا انتخاب می کنیم زیرا تفسیر آسان از برآورد پارامتر مدل را ارائه می دهد. در مرحله بعد ، متغیر "DV" را به قسمت "متغیر وابسته" ، متغیر "ساعت" به قسمت "همبستگی" و "توربین" به قسمت "تعداد کل آزمایشات" منتقل می کنیم (که وقتی "وزنه ها" نامگذاری شده استیک خانواده متفاوت انتخاب شده است).

برای پانل مدل ، ما همه چیز را به طور پیش فرض نگه می داریم. یعنی ما یک اصطلاح رهگیری را در مدل قرار می دهیم و هیچ اصطلاح اضافی را به مدل تهی اضافه نمی کنیم. برای پانل آمار ، جعبه های زیر را تیک بزنید.

تفسیر مدل

شکل 1. خلاصه مدل ، تناسب و ضرایب.

شکل 1 سه جدول مربوطه را نشان می دهد که خلاصه مدل است.

جدول اول ، "خلاصه مدل" ، مدل مورد علاقه (H1) را که شامل یک متغیرهای متغیر (یعنی ساعت ها) با مدل تهی (H0) است که فقط شامل یک اصطلاح رهگیری است ، مقایسه می کند. ما می توانیم ببینیم که از نظر انحراف ، AIC و BIC ، مدل H1 نسبت به مدل تهی برتر است. آزمون نسبتاً احتمال نشان می دهد که H1 از نظر آماری به طور قابل توجهی بهتر از H0 است (x2 = 102. 34 ، p< 0.001).

جدول دوم ، "مدل متناسب" ، مدل مورد علاقه (H1) را با مدل اشباع با استفاده از تست های Deviance و Pearson Goodness-of-Fit مقایسه می کند. هر دو نتیجه آزمون (به عنوان مثال مقادیر P بزرگ) نشان می دهد که مدل H1 ما از نظر آماری به طور قابل توجهی بدتر از مدل اشباع نیست ، که این نشان دهنده تناسب خوب است.

جدول سوم ، "ضرایب" ، مقادیر برآورد پارامتر مدل ما ، خطای استاندارد ، آمار آزمون (در این مورد ، Z) ، مقادیر P و فاصله اطمینان 95 ٪ را ارائه می دهد. ما می توانیم ببینیم که متغیرهای متغیر ، "ساعت" ، از نظر آماری به طور قابل توجهی پیش بینی کننده نسبت چرخ های توربین در حال ایجاد شکاف است. به طور خاص ، برای هر ساعت اضافی یک چرخ توربین اجرا می شود ، شانس ایجاد شکاف چرخ توربین با (EXP (0. 001) - 1)*100 ٪ = 0. 1 ٪ افزایش می یابد. اگر ساعت 1000 ساعت را در نظر بگیریم ، شانس ایجاد یک توربین در حال ایجاد شکاف با (EXP (0. 001*1000) - 1)*100 ٪ = 171. 82 ٪ افزایش می یابد. توجه داشته باشید که ما برای "ساعت" از ساعت 9. 992E-4 به 0. 001 برای راحتی برآورد می کنیم.

علم تشخیص

تجزیه و تحلیل بصری باقیمانده ها

برای شناسایی مشکلات ساختاری در مدل خود ، می توانیم باقیمانده ها را در برابر مقادیر متناسب و باقیمانده در برابر هر متغیر توضیحی ترسیم کنیم. به طور خاص ، دو جنبه مهم در نظر گرفته شده است:

  • روندها: در صورت وجود هرگونه روند در این توطئه ها ، این نشانگر این است که می توان مؤلفه سیستماتیک مدل را بهبود بخشید. این می تواند به معنای تغییر عملکرد پیوند ، اضافه کردن متغیرهای توضیحی اضافی یا تغییر متغیرهای توضیحی باشد.
  • تغییر ثابت: اگر مؤلفه تصادفی صحیح باشد (یعنی توزیع صحیح استفاده می شود) ، واریانس نقاط تقریباً ثابت است.

بنابراین ، توطئه های ایده آل نباید حاوی الگوی و روند باشد.

توجه داشته باشید که برای توزیع های گسسته مانند توزیع دوتایی ، باقیمانده های کمی (بر خلاف انحراف و باقیمانده های پیرسون) تشویق می شوند ، زیرا آنها به جلوگیری از حواس پرتی الگوهای موجود در باقیمانده کمک می کنند. با این حال ، همانطور که قبلاً ذکر شد ، محاسبه باقیمانده های کمی شامل ترسیم مقادیر تصادفی از توزیع است ، که منجر به مقادیر مختلف باقیمانده های کمی از یک قرعه کشی به دیگری می شود. بنابراین ، برای به دست آوردن همان نتایج دقیقاً نشان داده شده در زیر ، باید از همان دانه تصادفی (1) استفاده کنید که در اینجا استفاده می شود. برای انجام این کار ، به پانل Advanced Options بروید و گزینه "Set Seed" را تیک بزنید: در مرحله بعد ، جعبه های زیر را در زیر باقیمانده های Quantile تیک بزنید تا توطئه های باقیمانده مربوطه را بخواهید. ما می توانیم ببینیم که در هر دو قطعه (شکل 2 و 3) ، نقاط داده ها کم و بیش به طور تصادفی و بدون روند ظاهری پخش می شوند. این نشانگر عدم وجود شواهد در برابر مشخصات ما از مدل است.

شکل 2. باقیمانده های کمی استاندارد در مقابل مقادیر مناسب.

شکل 3. باقیمانده های کمی استاندارد در مقابل ساعت (پیش بینی کننده).

توجه داشته باشید که با استفاده از نقشه های مقادیر باقیمانده در مقابل مقادیر مناسب (شکل 2) ، محور x در مقیاس اصلی مقادیر مناسب نیست بلکه تبدیل می شود. دلیل استفاده از تحول ، ایجاد مقادیر مناسب به طور مساوی به صورت افقی است تا روندهای موجود در توطئه ها تشخیص آن آسان تر شوند. چنین تحولی به عنوان تحول تثبیت کننده واریانس (یا مقیاس اطلاعات ثابت) نامیده می شود و به طور خودکار در JASP اعمال می شود.

علاوه بر این ، ما می توانیم از یک قطعه Q-Q باقیمانده برای تشخیص باقیمانده های بزرگ استفاده کنیم (شکل 4 را ببینید). می بینیم که هیچ دور باقیمانده بزرگ (یا شاید یکی در گوشه بالا سمت راست) وجود ندارد.

شکل 4. نمودار Q-Q از باقیمانده های کمی استاندارد.

برای بررسی بیشتر عملکرد پیوند ، می توانیم پاسخ های کار را در برابر پیش بینی کننده خطی ترسیم کنیم. اگر عملکرد لینک مناسب باشد ، نقشه باید تقریباً خطی باشد. اگر یک انحنای قابل توجه در طرح آشکار باشد ، باید یک عملکرد پیوند متفاوت در نظر گرفته شود.

شکل 5. پاسخهای کار در مقابل پیش بینی کننده خطی.

در شکل 5 ، ما یک روند تقریبا خطی را مشاهده می کنیم ، نشان می دهد که انتخاب عملکرد Logit Link مناسب است. با این حال ، فقط برای نشان دادن آنچه اتفاق می افتد وقتی یک عملکرد پیوند نامناسب انتخاب می شود ، ما در شکل 6 چندین قطعه تشخیصی را بر اساس عملکرد پیوند Cauchit نشان می دهیم که برای این مجموعه داده کمتر مناسب است.

شکل 6. توطئه های تشخیصی بر اساس عملکرد پیوند Cauchit.

می توانیم ببینیم که در شکل 6 ، نقشه سمت چپ یک روند منحنی را نشان می دهد ، که نشان دهنده یک عملکرد لینک نامناسب است. نقشه های باقیمانده در مقابل نقشه مقادیر مناسب (در وسط) و باقی مانده در مقابل طرح پیش بینی کننده (در سمت راست) نیز در مقایسه با زمان استفاده از عملکرد پیوند ورود به سیستم ، تصادفی کمتری دارند.

بازگشت به وضعیت اصلی که از عملکرد Logit Link استفاده می شود. برای تعیین اینکه آیا یک متغیر متغیر در مقیاس صحیح گنجانده شده است ، می توانیم از یک طرح باقیمانده جزئی استفاده کنیم ، که اگر متغیرهای متغیر در مقیاس صحیح گنجانده شده باشد ، باید روند خطی را نشان دهد. در شکل 7 می توانیم در شکل 7 مشاهده کنیم که این مورد کم و بیش است. در زیر می بینیم که این کم و بیش مورد (فقط کمی خمیده) است.

شکل 7. طرح باقیمانده جزئی.

دور

برای تشخیص مسافت های بالقوه ، می توانیم سفره ای را ارائه دهیم که مواردی را با N (پیش فرض: 3) بزرگترین باقیمانده نشان دهد. در این حالت ، اگر آستانه 3 را انتخاب کنیم ، هیچ مسافتی بزرگ نگران کننده وجود ندارد که به توجه ما نیاز داشته باشد.

شکل 8. جدول خارج از کشور برتر بر اساس باقیمانده های کمی.

موارد تأثیرگذار

موارد تأثیرگذار با اهرم های بالایی هستند. ما می توانیم بر اساس اقدامات مختلف ، این موارد را درخواست کنیم. اگر "نسبت کواریانس" را انتخاب کنیم ، می بینیم که این مورد 4 و 10 (اعداد مربوط به شماره ردیف در مجموعه داده های اصلی است) موارد تأثیرگذار بالقوه ای هستند که ممکن است نیاز به تحقیقات بیشتر داشته باشند.

شکل 9. جدول موارد تأثیرگذار.

دارایی چند خطی

از آنجا که مدل ما فقط یک متغیر توضیحی دارد ، هیچ خطر چند قطبی وجود ندارد. با این حال ، در مدل هایی با پیش بینی کننده های متعدد ، می توانیم آمار تحمل و واریانس تورم (VIF) را برای ارزیابی مسائل بالقوه با چند خطی درخواست کنیم.

آینده

در حال حاضر ، فقط GLM مکرر در دسترس است. هدف ما برای همتای بیزی در آینده نزدیک است. ما همچنین می خواهیم GLM های دیگری را شامل کنیم ، مانند رگرسیون لجستیک سفارش داده شده و رگرسیون لجستیک چندمیک برای این زیر ماژول GLM مکرر.

اگر با استفاده از ماژول GLM به مشکل (به عنوان مثال اشکالات ، سؤالات) روبرو شدید ، یا اگر به ویژگی های مفید تری فکر می کنید ، می توانید از طریق https://github. com/jasp-stats/jasp-issues مسئله ای ایجاد کنید. که می توانیم آنها را دنبال کنیم.

منابع

Du ، P. K. ، & Smyth ، G. K. (2018). مدلهای خطی عمومی با مثال در R. New York: Springer.

Du ، P. K. ، & Smyth ، G. K. (2018). GLMSDATA: مجموعه داده های مدل خطی تعمیم یافته. نسخه بسته R 1. 0. 0. https://cran. r-project. org/package=glmsdata

درباره نویسندگان

Qixiang Fang

Qixiang Fang کاندیدای دکترا در دانشگاه اوترخت است.

Šimon Kucharský

Šimon کاندیدای دکترا در گروه روشهای روانشناختی دانشگاه آمستردام است.

فارکس را از کجا شروع کنیم...
ما را در سایت فارکس را از کجا شروع کنیم دنبال می کنید

برچسب : نویسنده : علیرضا خمسه بازدید : <-PostHit-> تاريخ : شنبه 27 اسفند 1401 ساعت: 15:51