پیوند یادگیری مخالف مولد و طبقه بندی باینری

ساخت وبلاگ

در این یادداشت ، ما به یک پیوند اساسی بین آموزش مخالفان مولد (GA) و طبقه بندی باینری اشاره می کنیم-هر تبعیض آمیز قدرتمند اساساً واگرایی (F-) بین نمونه های واقعی و تولید شده را محاسبه می کند. نتیجه ، که به طور مکرر در تئوری تصمیم گیری مجدداً مشتق شده است ، پیامدهای مربوط به شبکه های GA (GANS) را دارد ، و با طراحی عملکرد از دست دادن تبعیض آمیز ، یک دیدگاه جایگزین در مورد آموزش F-GAN ها ارائه می دهد.

تحقیقات مرتبط

∙ 04/08/2022

روش مخالف مولد مبتنی بر هسته های مماس عصبی

توسعه اخیر شبکه های مخالف مولد (GANS) دارای DRI است.

اشتراک گذاری

∙ 11/13/2016

حداقل مربعات شبکه های مخالف مولد

یادگیری بدون نظارت با شبکه های مخالف مولد (GANS) دارای روابط عمومی است.

اشتراک گذاری

∙ 03/05/2019

O-GAN: رویکرد بسیار مختصر برای رمزگذاری خودکار شبکه های طرفداری مولد

در این مقاله ، ما شبکه های مخالف مولد متعامد را پیشنهاد می کنیم (O-.

اشتراک گذاری

∙ 04/07/2020

اجرای موازی/توزیع شده آموزش سلولی برای شبکه های عصبی مخالف مولد

شبکه های مخالف تولید کننده (GAN) به طور گسترده ای برای یادگیری Generati استفاده می شوند.

اشتراک گذاری

12/18/2017

در مورد اثربخشی حداقل مربعات شبکه های مخالف مولد

یادگیری بدون نظارت با شبکه های مخالف مولد (GANS) دارای روابط عمومی است.

اشتراک گذاری

12/2020 ∙

یادگیری واگرایی متضاد یک بازی متضاد معکوس است

یادگیری واگرایی متضاد (CD) یک روش کلاسیک برای جاسازی U است.

اشتراک گذاری

∙ 11/06/2017

Kgan: چگونه می توان بازی Minimax را در GAN بشکند

شبکه های مخالف مولد (GAN) به صورت شهودی و جذاب بودند.

اشتراک گذاری

1 تولید توزیع

تصور کنید که ما داده های واقعی با توزیع p r (x) از فضای ویژگی X به ما داده می شود و آرزو می کنیم توزیع p g (x) را که تا حد امکان "نزدیک" است یاد بگیریم. نزدیکی توسط برخی از عملکرد واگرایی D (⋅ ، ⋅) اندازه گیری می شود

بین توزیع احتمال. بنابراین ژنراتور به طور معمول در حال حل است

P ∗ g = a r g i n f p g d (p g ، p r) (1)

جایی که P G در برخی از توزیع های توزیع شده توسط ژنراتور قرار دارد. این نسخه خطی D (⋅ ، ⋅) را به عنوان یک f- divergence می داند:

تعریف 1.

f-divergence. برای هر محدب f (t) با f (1) = 0 ، f-divergence p g به p r 1 1 1 را تعریف کنید. توجه داشته باشید که d f (p g ، p r) نیازی به مثبت نیست. مانند

d f (p g ، p r) = e x ∼ p r [f (p g (x) p r (x))]

در اینجا ما روش برجسته سازی تفاوت های بین P R و P G را بررسی می کنیم

با تغذیه آنها به یک طبقه بندی باینری (تبعیض آمیز) با برچسب های مربوطه

y = ± 1 ، به نسبت مساوی مانند یک تنظیم GAN معمولی ، به طوری که در صورت داشتن داده های واقعی ، ورودی داده به تبعیض آمیز یک برچسب مثبت اختصاص می یابد:

p: = pr (y = + 1) = 1 2 ، p r (x) = pr (x ∣ y = + 1) ، p g (x) = pr (x ∣ y = - 1)

به یاد بیاورید که هر عملکرد از دست دادن دو کلاس می تواند به طور معادل آن از نظر ضررهای جزئی ℓ + (g) و ℓ-(g) نوشته شود. این ضررها با توجه به برچسب های واقعی ± 1 ، به عنوان تابعی از پیش بینی برچسب g است.

مشکل تبعیض پیدا کردن یک تابع H در برخی از مدل های مدل H است که سعی در به حداقل رساندن برخی از دست دادن به طور متوسط نسبت به داده ها دارد:

inf h ∈ H e (x ، y) [ℓ (y ، h (x))] (2)

نمای مولد طبقه بندی باینری [RW11] این را از نظر توزیع های کلاس-شرط می نویسد (x ∣ y = ± 1):

e y [ℓ (y ، h (x))] = pr (x ، y = + 1) ℓ + (h (x)) + p r (x ، y = - 1) ℓ - (h (x))
= p pr (x ∣ y = + 1) ℓ + (h (x)) + (1 - p) pr (x ∣ y = - 1) ℓ - (h (x))
= 1 2 [p r (x) ℓ + (h (x)) + p g (x) ℓ - (h (x))]] (3)

مشکل بهینه سازی (2) در طبقه بندی باینری استاندارد است. به طور معمول ، H به عنوان یک طبقه نسبتاً غنی از طبقه بندی های باینری عمیق انتخاب می شود. این بدان معنی است که عملکرد آن نزدیک به خطر بیز است ، یعنی حداقل خطر نسبت به توابع قابل اندازه گیری ، [x ، y) [ℓ (y ، h (x))] [rw11]. بنابراین خطر اضافی

ϵ (h): = inf h ∈ H e (x ، y) [ℓ (y ، h (x))] - inf h e (x ، y) [ℓ (y ، h (x))]]

2 نتیجه اصلی

قضیه 2.

از هر عملکرد ضرر ℓ ± و هر کلاس مدل H استفاده کنید. تعریف f (s): = sup α ( - ℓ + (α) - s ℓ - (α)). این حداکثر عملکرد خطی است ، بنابراین محدب است. سپس

inf h ∈ H e (x ، y) [ℓ (y ، h (x))] = - 1 2 d f (p g ، p r) + ϵ (h)

تغییر کلاس مدل H فقط اصطلاح دوم THM را تغییر می دهد. 2بنابراین ، هنگامی که H به اندازه کافی ثروتمند باشد که خطر اضافی ϵ (H) کوچک باشد ، عملکرد ضرر ℓ مشکل تبعیض تقریباً دقیقاً مربوط به یک F-Divergence است.

2. 1 آموزش GA مشکل تولید را با F-Divergences حل می کند

تجدید نظر (1) ، برای یافتن p ∗ g به "نزدیک" به p r تحت برخی از f- divergence d f ، می توان آن را حل کرد

P ∗ g = a r g i n f p g d f (p g ، p r) = ∗ a r g s u p p g [ - d f (p g ، p r)] = a r g s u p pr (x ∣ y = - 1) [inf h ∈ H e (x ، y) [ℓ (y ، h (x))] - ϵ (h)]
≈ a r g s u p pr (x ∣ y = - 1) [inf h ∈ H e (x ، y) [ℓ (y ، h (x))]]]

بنابراین تعامل بازی مخالف بین ژنراتور و تبعیض آمیز به عنوان راه حل مشکل تولید برای تبعیض های قدرتمند قدرتمند ، برای هر ℓ ، ح.

2. 2 نمونه

جدول 1 مکاتبات بین ℓ و F را برای چندین بخش مشترک F نشان می دهد. لیست های مشابه را می توان در [NWJ09 ، RW11] یافت.

در تنظیم GA ، متغیر S همیشه تابعی از فضای داده X است. حداکثر α در یک r g s u p α ( - ℓ + (α) - s ℓ - (α)) تابعی از s است. به عنوان تابعی از داده α (x) ، این تبعیض بهینه H ∗ (x) = H ∗ (S (x)) است.

ضرر ضررهای جزئی F (ها) H ∗ (ها) f-divergence
0-1 ℓ ± (g) = 1 2 (1 ∓ گرم) 1 2 |S - 1 | SGN (S - 1) تغییر کلی.
ورود به سیستم ℓ ± (g) = ln (2 1 ± G) - ln (1 + s) - s ln (1 + s) 1 - S 1 + S Jensen-Shaon Dist.
مربع ℓ ± (g) = (1 ∓ گرم) 2 - S 1 + S + 1 2 1 - S 1 + S فاصله تبعیض مثلثی.
CW (Param. C) ℓ ± (g) = (1 2 - (1 2 - c)) (1 ∓ گرم) |1 - C - C S |- C S + C - |1 - 2 C | SGN (1 - C - C)
نمایشی ℓ ± (g) = exp (∓ g) - 2 √ S + 2 - 1 2 ln s هلینجر فاصله دارد.
"افزایش" ℓ ± (g) = √ 1 ∓ g 1 ± g - 2 √ S + 2 1 - S 1 + S هلینجر فاصله دارد.

جدول 1: برخی از ضررهای تبعیض آمیز ، با f- divergences مربوطه.

3 کار مرتبط

مهمترین کار برای این نسخه خطی ، رویکرد f-gan [NCT16] ، به دانش ما است. این همان مشکل به حداقل رساندن F- divergence به توزیع واقعی را حل می کند ، اما با تغییر هدف تبعیض آمیز از خطر طبقه بندی باینری ، (بر خلاف Thm. 2 که فقط خطر را تفسیر می کند). واقعیت اصلی این است که یک تابع محدب F دارای یک عملکرد کونژوگه محدب به خوبی تعریف شده f ∗ به گونه ای است که f (u) = sup t ∈ R [t u-f ∗ (t)] ، به طوری که موارد زیر 2 2 2 نادیده گرفتن استمسائل دامنه ترکیب برای سادگی.:

D F (P R ، P G) = e x ∼ p g [sup t (t p r (x) p g) - f ∗ (t))] = sup t (e x ∼ p g [t p r (x) p g (x)- f ∗ (t)])
(4)

[NCT16] از این محدوده از [NWJ10] استفاده کنید. وقتی H غنی است ، دقیقاً محکم است ، دقیقاً وقتی THM. 2 قوی است ، اگرچه ترتیب آرگومان ها تغییر یافته است. 3 3 3 توجه داشته باشید که (3) توزیع مدل (تولید شده) را در استدلال دوم به جای اولی قرار می دهد. این دو سفارش توسط دوگانگی Csiszár [RW11] مرتبط است. اثبات ما از قضیه 2 را می توان برای اثبات آنالوگ دقیق قضیه 2 مشاهده کرد که ریسک تبعیض آمیز را به عنوان d f (p r ، p g) با استدلال هایی که در (3) تعویض شده است ، دنبال می کند. نتیجه آنالوگ فقط در تعریف عملکرد محدب تولید واگرایی ، که SUP α ( - ℓ - (α) - S ℓ + (α)) به جای F است که در THM تعریف شده است ، متفاوت است. 2در این نسخه خطی ، ما از کنوانسیون استفاده از توزیع واقعی پیروی می کنیم تا دومین استدلال با توجه به اینکه "طول توضیحات اضافی" استفاده از p g را اندازه گیری می کنیم.

به طور گسترده تر ، از آنجا که مقاله اصلی GAN [GPAM + 14] ، رویکرد GA با توجه به THM ، از موفقیتهای تجربی اخیر با کلاسهای مدل بسیار غنی H [RMC15 ، BSM17] برخوردار بوده است. 2

4 خلاصه

مکاتبات در اینجا اساساً آموزش های مخالف مولد و مشکل تولید را پیوند می دهند و بیشتر آنها در تئوری تصمیم گیری به خوبی شناخته شده اند. با این حال ، در ادبیات GAN آنها به خوبی شناخته شده به نظر نمی رسند و فاقد منابع هستند ، که ما در این یادداشت به آنها می پردازیم.

منابع

  • [BSM17] دیوید برتلوت ، تام شووم و لوک متز. شروع: شبکه های مخالف تولید کننده تعادل مرزی. Arxiv preprint arxiv: 1703. 10717 ، 2017.
  • [GPAM + 14] Ian Goodfellow ، Jean Pouget-Abadie ، Mehdi Mirza ، Bing Xu ، David Warde-Farley ، Sherjil Ozair ، Aaron Courville و Yoshua Bengio. شبکه های مخالف مولد. در پیشرفت در سیستم های پردازش اطلاعات عصبی ، صفحات 2672-2680 ، 2014.
  • [LV06] فردریش لیز و ایگور واژدا. در مورد واگرایی و اطلاعات در آمار و نظریه اطلاعات. معاملات IEEE در تئوری اطلاعات ، 52 (10): 4394-4412 ، 2006.
  • [NCT16] Sebastian Nowozin ، Botond Cseke و Ryota Tomioka. F-GAN: آموزش نمونه برداری های عصبی تولیدی با استفاده از به حداقل رساندن واگرایی متغیر. در پیشرفت در سیستم های پردازش اطلاعات عصبی ، صفحات 271-279 ، 2016.
  • [NWJ09] Xuanlong Nguyen ، Martin J Wainwright و Michael I Jordan. در عملکردهای از دست دادن جانشین و واگرایی F. سالنامه های آمار ، صفحات 876-904 ، 2009.
  • [NWJ10] Xuanlong Nguyen ، Martin J Wainwright و Michael I Jordan. برآورد عملکردهای واگرایی و نسبت احتمال با به حداقل رساندن خطر محدب. معاملات IEEE در تئوری اطلاعات ، 56 (11): 5847-5861 ، 2010.
  • [RMC15] الک رادفورد ، لوک متز و سومیث چینتالا. یادگیری بازنمایی بدون نظارت با شبکه های ژنرال ژنرال عمیق. Arxiv preprint arxiv: 1511. 06434 ، 2015.
  • [RW11] مارک د رید و رابرت سی ویلیامسون. اطلاعات ، واگرایی و خطر آزمایش های باینری. مجله تحقیقات یادگیری ماشین ، 12 (مارس): 731-817 ، 2011.

5 اثبات

در این بخش توابع از دست دادن طبقه بندی باینری به f-divergences ، بازپس گیری [LV06 ، NWJ09] مربوط می شود.

اثبات قضیه 2.

از (1) ، اگر μ اندازه گیری پایه بیش از x باشد ،

inf h e (x ، y) [ℓ (y ، h (x))] = inf h e x [e y [ℓ (y ، h (x))]] = 1 2 inf h e x ∼ μ [p r (x) ℓ + (h (x)) + p g (x) ℓ - (h (x))]
= 1 2 inf h e x ∼ μ [p r (x) (ℓ + (h (x)) + p g (x) p r (x) ℓ - (h (x))))) = 1 2 inf he x ∼ p r [ℓ + (h (x)) + p g (x) p r (x) ℓ - (h (x))]]
= 1 2 e x ∼ p r [inf α (ℓ + (α) + p g (x) p r (x) ℓ - (α))] = - 1 2 e x ∼ p r [sup α ( - ℓ ℓ ℓ+ (α) - p g (x) p r (x) ℓ - (α))]]
= - 1 2 D F (P G ، P R)

افزودن ϵ (ساعت) به هر دو طرف نتیجه را اثبات می کند.∎

خبرهای فارکس...
ما را در سایت خبرهای فارکس دنبال می کنید

برچسب : نویسنده : شهره لرستانی بازدید : <-PostHit-> تاريخ : شنبه 7 مرداد 1402 ساعت: 12:25