در این یادداشت ، ما به یک پیوند اساسی بین آموزش مخالفان مولد (GA) و طبقه بندی باینری اشاره می کنیم-هر تبعیض آمیز قدرتمند اساساً واگرایی (F-) بین نمونه های واقعی و تولید شده را محاسبه می کند. نتیجه ، که به طور مکرر در تئوری تصمیم گیری مجدداً مشتق شده است ، پیامدهای مربوط به شبکه های GA (GANS) را دارد ، و با طراحی عملکرد از دست دادن تبعیض آمیز ، یک دیدگاه جایگزین در مورد آموزش F-GAN ها ارائه می دهد.




تحقیقات مرتبط
∙ 04/08/2022
روش مخالف مولد مبتنی بر هسته های مماس عصبی
توسعه اخیر شبکه های مخالف مولد (GANS) دارای DRI است.

اشتراک گذاری
∙ 11/13/2016
حداقل مربعات شبکه های مخالف مولد
یادگیری بدون نظارت با شبکه های مخالف مولد (GANS) دارای روابط عمومی است.

اشتراک گذاری
∙ 03/05/2019
O-GAN: رویکرد بسیار مختصر برای رمزگذاری خودکار شبکه های طرفداری مولد
در این مقاله ، ما شبکه های مخالف مولد متعامد را پیشنهاد می کنیم (O-.

اشتراک گذاری
∙ 04/07/2020
اجرای موازی/توزیع شده آموزش سلولی برای شبکه های عصبی مخالف مولد
شبکه های مخالف تولید کننده (GAN) به طور گسترده ای برای یادگیری Generati استفاده می شوند.

اشتراک گذاری
12/18/2017
در مورد اثربخشی حداقل مربعات شبکه های مخالف مولد
یادگیری بدون نظارت با شبکه های مخالف مولد (GANS) دارای روابط عمومی است.

اشتراک گذاری
12/2020 ∙
یادگیری واگرایی متضاد یک بازی متضاد معکوس است
یادگیری واگرایی متضاد (CD) یک روش کلاسیک برای جاسازی U است.

اشتراک گذاری
∙ 11/06/2017
Kgan: چگونه می توان بازی Minimax را در GAN بشکند
شبکه های مخالف مولد (GAN) به صورت شهودی و جذاب بودند.

اشتراک گذاری
1 تولید توزیع
تصور کنید که ما داده های واقعی با توزیع p r (x) از فضای ویژگی X به ما داده می شود و آرزو می کنیم توزیع p g (x) را که تا حد امکان "نزدیک" است یاد بگیریم. نزدیکی توسط برخی از عملکرد واگرایی D (⋅ ، ⋅) اندازه گیری می شود
بین توزیع احتمال. بنابراین ژنراتور به طور معمول در حال حل است
| P ∗ g | = a r g i n f p g d (p g ، p r) | (1) |
جایی که P G در برخی از توزیع های توزیع شده توسط ژنراتور قرار دارد. این نسخه خطی D (⋅ ، ⋅) را به عنوان یک f- divergence می داند:
تعریف 1.
f-divergence. برای هر محدب f (t) با f (1) = 0 ، f-divergence p g به p r 1 1 1 را تعریف کنید. توجه داشته باشید که d f (p g ، p r) نیازی به مثبت نیست. مانند
| d f (p g ، p r) = e x ∼ p r [f (p g (x) p r (x))] |
در اینجا ما روش برجسته سازی تفاوت های بین P R و P G را بررسی می کنیم
با تغذیه آنها به یک طبقه بندی باینری (تبعیض آمیز) با برچسب های مربوطه
y = ± 1 ، به نسبت مساوی مانند یک تنظیم GAN معمولی ، به طوری که در صورت داشتن داده های واقعی ، ورودی داده به تبعیض آمیز یک برچسب مثبت اختصاص می یابد:
| p: = pr (y = + 1) = 1 2 ، p r (x) = pr (x ∣ y = + 1) ، p g (x) = pr (x ∣ y = - 1) |
به یاد بیاورید که هر عملکرد از دست دادن دو کلاس می تواند به طور معادل آن از نظر ضررهای جزئی ℓ + (g) و ℓ-(g) نوشته شود. این ضررها با توجه به برچسب های واقعی ± 1 ، به عنوان تابعی از پیش بینی برچسب g است.
مشکل تبعیض پیدا کردن یک تابع H در برخی از مدل های مدل H است که سعی در به حداقل رساندن برخی از دست دادن به طور متوسط نسبت به داده ها دارد:
| inf h ∈ H e (x ، y) [ℓ (y ، h (x))] | (2) |
نمای مولد طبقه بندی باینری [RW11] این را از نظر توزیع های کلاس-شرط می نویسد (x ∣ y = ± 1):
| e y [ℓ (y ، h (x))] | = pr (x ، y = + 1) ℓ + (h (x)) + p r (x ، y = - 1) ℓ - (h (x)) |
| = p pr (x ∣ y = + 1) ℓ + (h (x)) + (1 - p) pr (x ∣ y = - 1) ℓ - (h (x)) |
| = 1 2 [p r (x) ℓ + (h (x)) + p g (x) ℓ - (h (x))]] | (3) |
مشکل بهینه سازی (2) در طبقه بندی باینری استاندارد است. به طور معمول ، H به عنوان یک طبقه نسبتاً غنی از طبقه بندی های باینری عمیق انتخاب می شود. این بدان معنی است که عملکرد آن نزدیک به خطر بیز است ، یعنی حداقل خطر نسبت به توابع قابل اندازه گیری ، [x ، y) [ℓ (y ، h (x))] [rw11]. بنابراین خطر اضافی
| ϵ (h): = inf h ∈ H e (x ، y) [ℓ (y ، h (x))] - inf h e (x ، y) [ℓ (y ، h (x))]] |
2 نتیجه اصلی
قضیه 2.
از هر عملکرد ضرر ℓ ± و هر کلاس مدل H استفاده کنید. تعریف f (s): = sup α ( - ℓ + (α) - s ℓ - (α)). این حداکثر عملکرد خطی است ، بنابراین محدب است. سپس
| inf h ∈ H e (x ، y) [ℓ (y ، h (x))] = - 1 2 d f (p g ، p r) + ϵ (h) |
تغییر کلاس مدل H فقط اصطلاح دوم THM را تغییر می دهد. 2بنابراین ، هنگامی که H به اندازه کافی ثروتمند باشد که خطر اضافی ϵ (H) کوچک باشد ، عملکرد ضرر ℓ مشکل تبعیض تقریباً دقیقاً مربوط به یک F-Divergence است.
2. 1 آموزش GA مشکل تولید را با F-Divergences حل می کند
تجدید نظر (1) ، برای یافتن p ∗ g به "نزدیک" به p r تحت برخی از f- divergence d f ، می توان آن را حل کرد
| P ∗ g | = a r g i n f p g d f (p g ، p r) = ∗ a r g s u p p g [ - d f (p g ، p r)] = a r g s u p pr (x ∣ y = - 1) [inf h ∈ H e (x ، y) [ℓ (y ، h (x))] - ϵ (h)] |
| ≈ a r g s u p pr (x ∣ y = - 1) [inf h ∈ H e (x ، y) [ℓ (y ، h (x))]]] |
بنابراین تعامل بازی مخالف بین ژنراتور و تبعیض آمیز به عنوان راه حل مشکل تولید برای تبعیض های قدرتمند قدرتمند ، برای هر ℓ ، ح.
2. 2 نمونه
جدول 1 مکاتبات بین ℓ و F را برای چندین بخش مشترک F نشان می دهد. لیست های مشابه را می توان در [NWJ09 ، RW11] یافت.
در تنظیم GA ، متغیر S همیشه تابعی از فضای داده X است. حداکثر α در یک r g s u p α ( - ℓ + (α) - s ℓ - (α)) تابعی از s است. به عنوان تابعی از داده α (x) ، این تبعیض بهینه H ∗ (x) = H ∗ (S (x)) است.
| ضرر | ضررهای جزئی | F (ها) | H ∗ (ها) | f-divergence |
| 0-1 | ℓ ± (g) = 1 2 (1 ∓ گرم) | 1 2 |S - 1 | | SGN (S - 1) | تغییر کلی. |
| ورود به سیستم | ℓ ± (g) = ln (2 1 ± G) | - ln (1 + s) - s ln (1 + s) | 1 - S 1 + S | Jensen-Shaon Dist. |
| مربع | ℓ ± (g) = (1 ∓ گرم) 2 | - S 1 + S + 1 2 | 1 - S 1 + S | فاصله تبعیض مثلثی. |
| CW (Param. C) | ℓ ± (g) = (1 2 - (1 2 - c)) (1 ∓ گرم) | |1 - C - C S |- C S + C - |1 - 2 C | | SGN (1 - C - C) | |
| نمایشی | ℓ ± (g) = exp (∓ g) | - 2 √ S + 2 | - 1 2 ln s | هلینجر فاصله دارد. |
| "افزایش" | ℓ ± (g) = √ 1 ∓ g 1 ± g | - 2 √ S + 2 | 1 - S 1 + S | هلینجر فاصله دارد. |
جدول 1: برخی از ضررهای تبعیض آمیز ، با f- divergences مربوطه.
3 کار مرتبط
مهمترین کار برای این نسخه خطی ، رویکرد f-gan [NCT16] ، به دانش ما است. این همان مشکل به حداقل رساندن F- divergence به توزیع واقعی را حل می کند ، اما با تغییر هدف تبعیض آمیز از خطر طبقه بندی باینری ، (بر خلاف Thm. 2 که فقط خطر را تفسیر می کند). واقعیت اصلی این است که یک تابع محدب F دارای یک عملکرد کونژوگه محدب به خوبی تعریف شده f ∗ به گونه ای است که f (u) = sup t ∈ R [t u-f ∗ (t)] ، به طوری که موارد زیر 2 2 2 نادیده گرفتن استمسائل دامنه ترکیب برای سادگی.:
| D F (P R ، P G) | = e x ∼ p g [sup t (t p r (x) p g) - f ∗ (t))] = sup t (e x ∼ p g [t p r (x) p g (x)- f ∗ (t)]) |
| (4) |
[NCT16] از این محدوده از [NWJ10] استفاده کنید. وقتی H غنی است ، دقیقاً محکم است ، دقیقاً وقتی THM. 2 قوی است ، اگرچه ترتیب آرگومان ها تغییر یافته است. 3 3 3 توجه داشته باشید که (3) توزیع مدل (تولید شده) را در استدلال دوم به جای اولی قرار می دهد. این دو سفارش توسط دوگانگی Csiszár [RW11] مرتبط است. اثبات ما از قضیه 2 را می توان برای اثبات آنالوگ دقیق قضیه 2 مشاهده کرد که ریسک تبعیض آمیز را به عنوان d f (p r ، p g) با استدلال هایی که در (3) تعویض شده است ، دنبال می کند. نتیجه آنالوگ فقط در تعریف عملکرد محدب تولید واگرایی ، که SUP α ( - ℓ - (α) - S ℓ + (α)) به جای F است که در THM تعریف شده است ، متفاوت است. 2در این نسخه خطی ، ما از کنوانسیون استفاده از توزیع واقعی پیروی می کنیم تا دومین استدلال با توجه به اینکه "طول توضیحات اضافی" استفاده از p g را اندازه گیری می کنیم.
به طور گسترده تر ، از آنجا که مقاله اصلی GAN [GPAM + 14] ، رویکرد GA با توجه به THM ، از موفقیتهای تجربی اخیر با کلاسهای مدل بسیار غنی H [RMC15 ، BSM17] برخوردار بوده است. 2
4 خلاصه
مکاتبات در اینجا اساساً آموزش های مخالف مولد و مشکل تولید را پیوند می دهند و بیشتر آنها در تئوری تصمیم گیری به خوبی شناخته شده اند. با این حال ، در ادبیات GAN آنها به خوبی شناخته شده به نظر نمی رسند و فاقد منابع هستند ، که ما در این یادداشت به آنها می پردازیم.
منابع
- [BSM17] دیوید برتلوت ، تام شووم و لوک متز. شروع: شبکه های مخالف تولید کننده تعادل مرزی. Arxiv preprint arxiv: 1703. 10717 ، 2017.
- [GPAM + 14] Ian Goodfellow ، Jean Pouget-Abadie ، Mehdi Mirza ، Bing Xu ، David Warde-Farley ، Sherjil Ozair ، Aaron Courville و Yoshua Bengio. شبکه های مخالف مولد. در پیشرفت در سیستم های پردازش اطلاعات عصبی ، صفحات 2672-2680 ، 2014.
- [LV06] فردریش لیز و ایگور واژدا. در مورد واگرایی و اطلاعات در آمار و نظریه اطلاعات. معاملات IEEE در تئوری اطلاعات ، 52 (10): 4394-4412 ، 2006.
- [NCT16] Sebastian Nowozin ، Botond Cseke و Ryota Tomioka. F-GAN: آموزش نمونه برداری های عصبی تولیدی با استفاده از به حداقل رساندن واگرایی متغیر. در پیشرفت در سیستم های پردازش اطلاعات عصبی ، صفحات 271-279 ، 2016.
- [NWJ09] Xuanlong Nguyen ، Martin J Wainwright و Michael I Jordan. در عملکردهای از دست دادن جانشین و واگرایی F. سالنامه های آمار ، صفحات 876-904 ، 2009.
- [NWJ10] Xuanlong Nguyen ، Martin J Wainwright و Michael I Jordan. برآورد عملکردهای واگرایی و نسبت احتمال با به حداقل رساندن خطر محدب. معاملات IEEE در تئوری اطلاعات ، 56 (11): 5847-5861 ، 2010.
- [RMC15] الک رادفورد ، لوک متز و سومیث چینتالا. یادگیری بازنمایی بدون نظارت با شبکه های ژنرال ژنرال عمیق. Arxiv preprint arxiv: 1511. 06434 ، 2015.
- [RW11] مارک د رید و رابرت سی ویلیامسون. اطلاعات ، واگرایی و خطر آزمایش های باینری. مجله تحقیقات یادگیری ماشین ، 12 (مارس): 731-817 ، 2011.
5 اثبات
در این بخش توابع از دست دادن طبقه بندی باینری به f-divergences ، بازپس گیری [LV06 ، NWJ09] مربوط می شود.
اثبات قضیه 2.
از (1) ، اگر μ اندازه گیری پایه بیش از x باشد ،
| inf h | e (x ، y) [ℓ (y ، h (x))] = inf h e x [e y [ℓ (y ، h (x))]] = 1 2 inf h e x ∼ μ [p r (x) ℓ + (h (x)) + p g (x) ℓ - (h (x))] |
| = 1 2 inf h e x ∼ μ [p r (x) (ℓ + (h (x)) + p g (x) p r (x) ℓ - (h (x))))) = 1 2 inf he x ∼ p r [ℓ + (h (x)) + p g (x) p r (x) ℓ - (h (x))]] |
| = 1 2 e x ∼ p r [inf α (ℓ + (α) + p g (x) p r (x) ℓ - (α))] = - 1 2 e x ∼ p r [sup α ( - ℓ ℓ ℓ+ (α) - p g (x) p r (x) ℓ - (α))]] |
| = - 1 2 D F (P G ، P R) |
افزودن ϵ (ساعت) به هر دو طرف نتیجه را اثبات می کند.∎
خبرهای فارکس...
ما را در سایت خبرهای فارکس دنبال می کنید
برچسب :
نویسنده : شهره لرستانی
بازدید : <-PostHit->
تاريخ : شنبه
7 مرداد
1402 ساعت: 12:25