Onormal upptäckt i Big Data-video med en förbättrad autokodare

Jul 12, 2023

1. Introduktion

Som en datorseendeuppgift på hög nivå hänvisar videoavvikelsedetektering till den automatiska upptäckten av onormala händelser i en given videosekvens, vilket effektivt kan särskilja onormala och normala aktiviteter och onormala kategorier i videon. Under de senaste åren har forskare utfört mycket forskning relaterad till anomalidetektering [1–9]. Jämfört med normala händelser anses händelser som sällan inträffar eller har låg sannolikhet att inträffa vanligtvis som onormala. Men i praktiken är det svårt att etablera en effektiv avvikelsedetekteringsmodell på grund av okända händelsetyper och oklara definitioner av anomalier. De flesta befintliga anomalidetekteringsmetoder är utformade utifrån antagandet att alla mönster som skiljer sig från det inlärda normala mönstret betraktas som anomalier. Baserat på sådana antaganden kan samma aktivitet i olika scenarier representeras som normala eller onormala händelser. Till exempel kan en slagsmålsscen där två personer slåss på gatan anses vara onormal, medan de två personerna är normala när de boxas. Dessutom finns det en stor mängd redundant visuell information i högdimensionell videodata, vilket ökar svårigheten med händelserepresentation i videosekvensen.

Cistanche deserticola slice (12)

Kinesisk ört cistanche

Enligt tidigare arbeten kan anomalidetekteringsmetoder generellt delas in i två typer. Vissa anomalidetekteringsmetoder är designade genom rekonstruktionsfel, som fokuserar på att modellera normala mönster i videosekvenser [3–5, 7, 8, 10, 11]. (dessa metoder lär sig funktionsrepresentationsmodellen för det normala mönstret i träningsfasen och använder skillnaderna mellan de onormala och normala proven för att bestämma det slutliga onormala resultatet för testdata under testfasen, såsom rekonstruktionsfel eller specifika tröskelvärden [7 –14]. Även om de rekonstruktionsbaserade anomalidetekteringsmetoderna är bra på att rekonstruera normala mönster i videosekvenser, är nyckelproblemet med dessa metoder att de är mycket beroende av träningsdata. En annan typ av metod betraktar anomalidetektering som ett klassificeringsproblem [ 15, 16]. För dessa metoder förutsägs anomalipoängen för en videosekvens genom att använda en tränad klassificerare för att extrahera funktioner som ett histogram av optisk fellow (HOF) eller dynamisk textur (DT). (dessa metoders prestanda är mycket beroende av träningsproverna. För att få tillfredsställande prestanda är det viktigt att extrahera effektiva och diskriminerande egenskaper för sådana anomalidetekteringsmetoder [17–20]. De två typerna av metoder modellerar dock vanligtvis sambanden mellan händelser på ett relativt enkelt sätt [7, 10, 21–23]. Till exempel beaktas endast det linjära sambandet, vilket inte räcker för komplexa, mycket olinjära samband i många verkliga fall.

what does cistanche do

Öken levande cistanche

Under de senaste åren har metoder baserade på djupinlärning tillämpats på området videodetektion och gjort stora framsteg [24–26]. Till exempel använder autoencoders (AE) rekonstruktionsfel för att upptäcka anomalier, och en rad metoder har förbättrats utifrån detta. Dessutom har generativa motstridiga nätverk (GAN) och långtidsminne (LSTM) också använts för att lösa problemet med anomalidetektering. Emellertid kan AE ha en stark generaliseringsförmåga, vilket resulterar i förmågan att rekonstruera onormala händelser. I [14] påpekade forskarna att eftersom det inte finns några onormala träningsprover bör rekonstruktionen av onormala prover vara oförutsägbar, vilket kan leda till större rekonstruktionsfel för onormala prover. Om vissa anomalier delar ett gemensamt sammansättningsmönster med normal träningsdata eller om avkodaren är "för stark" och inte kan avkoda vissa anomalikoder väl, då kan AE rekonstruera anomalibrunnen. För att övervinna bristerna med AE, använder detta papper en minnesmodul för att förbättra den djupa AE och utvecklar en minnesförstärkt AE-metod (Memory AE). När ett nytt testprov matas in kommer Memory AE inte direkt att koda det och mata in det i avkodaren utan använda det som en fråga för att hämta det relevanta innehållet i minnesmodulen. (sv, innehållet aggregeras och skickas in i avkodaren. (processen realiseras genom uppmärksamhetsadressering. Dessutom använder denna uppsats differentierbara krympningsoperatorer för att framkalla sparsamheten i minnesadresseringsvikter, vilket kan uppmuntra minnesinnehåll att närma sig frågor i funktionen utrymme. Under träningsfasen uppdaterar kodaren och avkodaren minnesmodulen samtidigt för att få ett lägre genomsnittligt rekonstruktionsfel. I testfasen fixeras det inlärda minnesinnehållet och en liten mängd normala minnesobjekt kommer att användas för rekonstruktion. Om dessa väljs som grannskap för inmatningskoden, kommer rekonstruktionsfelet att vara mycket uppenbart. Experiment på flera offentliga benchmark-datauppsättningar visar att detekteringsprestandan för Memory AE har nått den senaste tekniken.

Main Chemical Constituents of Cistanche deserticola

Huvudkemiska beståndsdelar i Cistanche deserticola

2. Algoritmens princip

Figur 1 visar den övergripande nätverksstrukturen för Memory AE, som är uppdelad i tre understrukturer: kodare (används för att koda indata och generera frågor), avkodare (används för rekonstruktion) och minnesmodul (med minne och relaterade adresseringsoperationer). Som visas i figur 1, givet den händelse som ska testas, erhåller kodaren först sitt kodade värde. Genom att använda det kodade värdet som en fråga, hämtar minnesmodulen det mest relevanta innehållet i minnesmodulen genom en uppmärksamhetsbaserad adresseringsoperatör och skickar det sedan till avkodaren för rekonstruktion. Under träningen optimerar kodaren och avkodaren parametrarna för att minimera rekonstruktionsfelet och uppdaterar samtidigt minnesmodulen för att registrera prototypelementen för den kodade normala datan. Givet ett testprov använder modellen endast de begränsade normala mönstren som registrerats i minnesmodulen för att utföra rekonstruktionen. På detta sätt tenderar rekonstruktionen att vara nära det normala provet. Följaktligen är rekonstruktionsfelet för det normala provet litet, och det onormala felet är stort.

Figur 1: (e flödesschemat för det föreslagna minnet AE.

Figure 1: (e flflowchart of the proposed memory AE.  image

2.1. Kodare och avkodare. (e-kodaren och avkodaren är två delar av AE. (den förra mappar indata till funktionsutrymmet för att erhålla dess kodade värde, och den senare rekonstruerar det kodade värdet till indata. (e AE består av en kodare fw1 (·) och en avkodare gw2 (·), som kan uttryckas som

image

där x och x′ är ingången för AE respektive den rekonstruerade ingången, z är kodningsresultaten för x, och W1 och W2 anger parametrarna för kodaren och avkodaren, vilket kan erhållas genom att minimera rekonstruktionsfelet mellan x och x′:

image


Genom att rekonstruera felet hos det normala provet [19, 20] för att avgöra om det är onormalt, har AE framgångsrikt använts för att lösa den onormala detekteringsuppgiften. Rekonstruktionen av onormala prover bör dock vara oförutsägbar, vilket kan resultera i större rekonstruktionsfel för onormala prover. För att lösa detta problem introduceras en minnesmodul till AE i avsnitt 2.2, och en Memory AE föreslås.

2.2. Minnesmodul. (Det föreslagna förfarandet inkluderar en minnesmodul för att spela in prototypkodningsläget och en adresseringsoperation för åtkomst till minnesmodulen.

2.2.1. Uppmärksamhetsbaserad representation. (uppmärksamhetsmodulen är utformad som en matris M ∈ RN×C innehållande N realtidsvektor. Antag för enkelhetens skull att C är dimensionen av z; låt sedan Ζ � RC. Givet en radvektor mi, ∀i ∈ [ N], där [N] är ett heltal från 1 till N. Var och en representerar mi ett minnesobjekt; givet en uppsättning frågor z ∈ RC, erhåller minnesnätverket?z och svarar med en mjuk adressvektor w ∈ R1×N som följer:

image


där w är en radvektor och summan av alla objekt är 1, vilket representerar wi, objektet w av i. (e viktvektorn kan erhållas genom z-beräkning. Som visas i ekvation (4), måste adressvikten vara nära w minnesmodulen. (en blandad parameter definieras som N, minnesmodulens maximala kapacitet. Även om det är N, är det inte lätt att hitta det bästa för olika datauppsättningar, lyckligtvis är Memory AE inte känsligt för inställningen av N. Tillräckligt mycket kan stort N appliceras på varje datauppsättning.

2.2.2. Uppmärksamhet för minnesadressering. I Memory AE är minnesmodulen utformad för att i detalj registrera det ursprungliga normalläget M för träningsfasen. (e minnesmodulen definieras som innehållsadresserbart minne, z⌢ , och dess adresseringsschema beräknar w, uppmärksamhetsvikten, baserat på likheten mellan frågan och minnesobjektet. Som visas i figur 1 kan varje vikt beräknas genom softmax drift wi:

image

där d(·, ·) representerar likhetsmåttet. (är papper definierar det som en cosinuslikhet:

image


Precis som ekvationerna (4)–(6), hämtar minnesmodulen det mest lika minnesobjektet för att få en representation av z. På grund av begränsningen av minnesstorlek och sparsam adresseringsteknik kan endast ett litet antal internminnesobjekt adresseras åt gången. (Därför kan minnesmodulens effektiva beteende förklaras enligt följande. I träningsfasen är avkodaren i Memory AE begränsad till att använda väldigt få adresserbara minnesobjekt för rekonstruktion, vilket kräver effektiv användning av minnesobjekt. (därför , under rekonstruktionen måste minnesmodulen tvingas att spela in det mest representativa prototypläget i ingångsnormalläget. I testfasen, givet det tränade minnet, kan endast normalläget i minnet hämtas för rekonstruktion. (därför Normala sampel kan rekonstrueras bättre. Omvänt kan det kodade värdet för den onormala ingången ersättas av det återvunna normala mönstret, vilket resulterar i ett stort rekonstruktionsfel i det onormala samplet.

2.3. Träning. Givet en datauppsättning som innehåller prover xi? ?TI�1, låt xi′ beteckna rekonstruktionsproverna av xi i träningsproverna; den minimala refaktoreringen utförs enligt följande:

image

(e l2-normen används för att mäta rekonstruktionsfelet; wi′ representerar minnesadresseringsvikten för varje prov xi. För att ytterligare främja glesheten i w′ minimeras den glesa regulariseringen under träning. Med tanke på att alla w′ är icke-negativa och ‖w′‖1 � 1, ett optimeringsproblem bildas enligt följande:

image

Genom att kombinera förlustfunktionen i ekvation (7) och ekvation (8), är den objektiva funktionen för Memory AE som följer:

image


här är hyperparametern i träningsprocessen. I praktiken är inställd på 0.0002. I träningsprocessen uppdateras minnet genom backpropagation och gradient descent. Vid backpropagation kan endast gradienten för minnesobjektet med adresseringsvikt som inte är noll vara från noll.

2.4. Testa. Efter att modellen har tränats kan rekonstruktionsfelet för pixeln vid positionen (x, y) för tandramen t beräknas med följande ekvation:

image

där h(·) representerar hela modellen. Givet rekonstruktionsfelet på pixelnivå för den tionde bildrutan, kan rekonstruktionsfelet för hela bildens bildruta erhållas genom att summera e(t) � . (x,y)e(x,y,t). (sv, anomalipoängen för ramen kan beräknas enligt följande:

image


Slutligen kan ett tröskelvärde sättas för att bestämma om det är onormalt eftersom s(t) > θ.

3. Experimentera

I detta avsnitt verifieras effektiviteten av den föreslagna metoden och jämförs med andra befintliga metoder. För närvarande används två offentliga datauppsättningar för experiment, det vill säga Avenue dataset och ShanghaiTech dataset. (E ramnivåområde under kurvan (AUC) och EER används som kvantitativa utvärderingsindikatorer.

3.1. Förberedelse. (e Avenue dataset använder en fast kamera med en upplösning på 640 × 360 pixlar för att fånga och spela in gatuaktiviteterna vid City University of Hong Kong. (e dataset Computational Intelligence and Neuroscience 3 innehåller 16 träningsvideoklipp som innehåller normalt mänskligt beteende och 21 testvideoklipp som innehåller onormala händelser och mänskligt beteende. Den har totalt 30652 bildrutor, och alla testvideor har annoteringar på målnivå, det vill säga ett rektangulärt område används för att markera anomalier på rumsliga platser. Normalt beteende är människor som går på trottoaren, medan onormala händelser är människor som skräpar ner/slänger föremål, vandrar, går mot kameran, går på gräset och slänger föremål. (ShanghaiTech-datauppsättningen är en mycket utmanande samling för att upptäcka onormala händelser. Till skillnad från andra datauppsättningar innehåller den 13 olika datauppsättningar scener med olika ljusförhållanden och kameravinklar, inklusive totalt 330 träningsvideor och 107 testvideor. (Testsetet innehåller totalt 130 onormala händelser med anteckningar på pixelnivå. (hela datauppsättningen har totalt 316154 bildrutor, inklusive 274515 bildrutor i träningsuppsättningen, 42883 bildrutor i testsetet och 17090 bildrutor i den onormala bildrutan. (e upplösningen för varje videobildruta är 480 × 856. (modellen är testade på en plattform med NVIDIA GTX1080TI hårdvaruplattform och 8 GB videominne, och mjukvarumiljön är PyTorch och Python 3.6. För att mäta effektiviteten av metoden för videoavvikelsedetektering som föreslås i detta dokument, AUC för ramnivån mottagarens funktionskarakteristikkurva (ROC) används som utvärderingsindex. För utvärderingsindikatorer på ramnivå, om minst en pixel i en bildruta markeras som onormal, anses bilden vara onormal. Och AUC för bildrutenivån beräknas genom att jämföra resultat för detektering på ramnivå med ramnivån för den verkliga etiketten.

Main Chemical Constituents of Cistanche deserticola2

Huvudkemiska beståndsdelar i Cistanche deserticola

Klicka här för att se produkter från Cistanche

【Be om mer】 E-post:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

3.2. Experimentuppställning. Alla videorutor justeras till 227 × 227 och konverteras sedan till gråskalebilder. (modellens ingång är 227 × 227 × 5, det vill säga 5 på varandra följande ramar används som indata för modellen. Efter varje faltningslager finns det ett batch-normaliseringslager och ett ReLU-exciteringslager. (e avkodare innehåller 4 deconvolution-lager. (En uppmärksamhetsmodul är inställd för att låta varje minnessegment spela in en funktion på en pixel i funktionskartan, motsvarande en underregion av videosegmentet. (därför är minnesmodulen en 10 00 × 64-matris. (e Adam-optimeraren är vald för optimering av hela modellens parametrar. (den initiala inlärningshastigheten är 0,0001 och antalet iterationer är 1000. (e momentumparametern är ρ1 � 0,9 och ρ2 � 0,999, och batchstorleken är 128.

3.3. Experimentella resultat. För att bevisa effektiviteten av den föreslagna metoden för upptäckt av videoavvikelser, jämför denna artikel den med 12 olika befintliga metoder. Bland dem är MPPCA (hybrid of probabilistic principal component analyzer) plus SF (social power) [17] och MDT (hybrid of dynamic texture) [18] metoder baserade på manuella funktioner; Conv-AE [8], 3D Conv [19], Stacked RNN [20] och ConvLSTM-AE [21], MemNormality [10] och ClusterAE [22] är alla metoder baserade på autokodare; AbnormalGAN [7] och Pred plus Recon [23] är baserade på att generera de kontradiktoriska nätverkens metod. Tabell 1 visar resultaten för detektering av videoavvikelser på ramnivå för olika metoder. Det kan observeras att i resultaten av de två datamängderna är metoden baserad på AE vanligtvis bättre än metoden baserad på handgjorda funktioner, och högre ramnivå AUC erhålls. (beror på att handgjorda funktioner vanligtvis extraheras baserat på andra uppgifter, och därför kan vara suboptimala. I de AE-baserade metoderna är ConvLSTM-AE bättre än Conv-AE eftersom de förra bättre kan fånga tidsinformation. Dessutom kan den också noteras att metoder baserade på GAN presterar bättre än de flesta baslinjemetoder. Slutligen uppnår Memory AE-metoden som föreslås i detta dokument 85,7 procent AUC på ramnivå på Avenue-datauppsättningen, vilket är 0,6 procent före den bäst presterande Pred plus Recon [23] metoden; medan metoden som föreslagits i detta dokument uppnådde 75,3 procent AUC på ramnivå på ShanghaiTech-datauppsättningen, vilket är 2 procent före andra metoder i ramnivå AUC, och effekten är mycket uppenbar. (beror främst på att Den föreslagna metoden baserad på Memory AE använder minnesfragment, som kan rekonstruera anomalier väl och introducera några slumpmässiga fel. Jämfört med Avenue-datauppsättningen har dessutom ShanghaiTech-datauppsättningen uppnått en högre ramnivå AUC. (beror främst på att ShanghaiTech-datauppsättningen innehåller flera scener och onormala händelser som inte har förekommit i andra datauppsättningar tidigare, vilket är mer komplicerat. För att verifiera detekteringsresultaten för en enskild scen på ShanghaiTech-datauppsättningen används ett videosegment med en scen för träning och testning. 83 segment (25 procent ) används för utbildning och 34 segment (32 procent ) används för testning, vilket uppnår 86,3 procent AUC på ramnivå, vilket har nått en nivå som liknar den i Avenue-datauppsättningen. Sammanfattningsvis kan den föreslagna Memory AE-metoden tillämpas flexibelt på olika typer av data. Endast genom att använda rekonstruktionsfel kan den föreslagna metoden få bättre resultat med minsta specifika kunskap. För att utvärdera prestandan hos den fördefinierade minnesmodulen för att upptäcka onormala videohändelser är nästa steg att ändra storleken på minnesmodulen och utföra experiment på Avenue-datauppsättningen, och AUC-värdena på ramnivå anges i tabell 2. Det kan man konstatera att med en tillräckligt stor minnesmodulstorlek kan Memory AE-metoden ge de bästa resultaten robust. När storleken på minnesmodulen är större än 1 000 är påverkan på detekteringsresultatet liten, men användningen av en större minnesmodulstorlek kommer att resultera i en större mängd beräkningar, så minnesmodulstorleken väljs till 1 000. Figurer 2(a) respektive 2(b) visar vissa detekteringsresultat i Avenue-datauppsättningen och ShanghaiTech-datauppsättningen. (e Tabell 1: Jämförelse med de senaste metoderna vad gäller AUC.

image


bättre än metoden baserad på handgjorda funktioner, och högre ramnivå AUC erhålls. (beror på att handgjorda funktioner vanligtvis extraheras baserat på andra uppgifter, och därför kan vara suboptimala. I de AE-baserade metoderna är ConvLSTM-AE bättre än Conv-AE eftersom de förra bättre kan fånga tidsinformation. Dessutom kan den också noteras att metoder baserade på GAN presterar bättre än de flesta baslinjemetoder. Slutligen uppnår Memory AE-metoden som föreslås i detta dokument 85,7 procent AUC på ramnivå på Avenue-datauppsättningen, vilket är 0,6 procent framför bäst presterande Pred plus Recon [23]-metoden; medan metoden som föreslås i denna artikel uppnådde 75,3 procent AUC på ramnivå på ShanghaiTech-datauppsättningen, vilket är 2 procent före andra metoder i AUC på ramnivå, och effekten är mycket uppenbar . (beror främst på att den föreslagna metoden baserad på Memory AE använder minnesfragment, som kan rekonstruera anomalier väl och introducera några slumpmässiga fel. Jämfört med Avenue-datasetet har ShanghaiTech-datauppsättningen dessutom uppnått en högre ramnivå AUC. (är främst för att ShanghaiTech-datauppsättningen innehåller flera scener och onormala händelser som inte har förekommit i andra datauppsättningar tidigare, vilket är mer komplicerat. För att verifiera detekteringsresultaten för en enskild scen på ShanghaiTech-datauppsättningen används ett videosegment med en scen för träning och testning. 83 segment (25 procent ) används för utbildning och 34 segment (32 procent ) används för testning, vilket uppnår 86,3 procent AUC på ramnivå, vilket har nått en nivå som liknar den i Avenue-datauppsättningen. Sammanfattningsvis kan den föreslagna Memory AE-metoden flexibelt tillämpas på olika typer av data. Endast genom att använda rekonstruktionsfel kan den föreslagna metoden få bättre resultat med minsta specifika kunskap. För att utvärdera prestandan hos den fördefinierade minnesmodulen för att upptäcka onormala videohändelser är nästa steg att ändra storleken på minnesmodulen och utföra experiment på Avenue-datauppsättningen, och AUC-värdena på ramnivå anges i tabell 2. Det kan man konstatera att med en tillräckligt stor minnesmodulstorlek kan Memory AE-metoden ge de bästa resultaten robust. När storleken på minnesmodulen är större än 1 000 är påverkan på detekteringsresultatet liten, men användningen av en större minnesmodulstorlek kommer att resultera i en större mängd beräkningar, så minnesmodulstorleken väljs till 1 000. Figurer 2(a) respektive 2(b) visar vissa detekteringsresultat i Avenue-datauppsättningen och ShanghaiTech-datauppsättningen. (ramar i den gröna rutan är normala bildrutor från vanliga videoklipp, och ramarna i den röda rutan är onormala bildrutor från onormala videoklipp. Vissa onormala händelser som att tappa konfetti, cykla på trottoaren, misshandel etc. kan upptäckas.

Tabell 2: (e påverkan av antalet minnesstorlekar på experimentresultaten av Avenue-datauppsättningen (bildrutenivå AUC/procent).

Table 2: (e influence of the number of memory size on the experimental results of the Avenue dataset (frame-level AUC/%).  image

Figur 2: Exempel på detekteringsresultaten. (a) Exempel från datauppsättningen Avenue. (b) Exempel från ShanghaiTech dataset.

Figure 2: Examples of the detection results. (a) Example from the Avenue dataset. (b) Example from the ShanghaiTech dataset.  image


4. Slutsats

(is paper föreslår en Memory AE för att förbättra prestandan för avkänning av big data-avvikelser i videor. Med tanke på en input använder den föreslagna Memory AE-metoden först en kodare för att erhålla en kodad representation och använder sedan koden som en fråga för att hämta den mest relevanta mönster i minnesmodulen för rekonstruktion Eftersom minnesmodulen är tränad att registrera typiska normala mönster, kan den föreslagna Memory AE rekonstruera normala prover väl och förstora rekonstruktionsfelet av abnormiteter, vilket stärker rollen av rekonstruktionsfel som en standard för avvikelsedetektering. Experiment på två datauppsättningar bevisar den föreslagna metodens mångsidighet och effektivitet. I framtiden kommer vi att studera användningen av adresseringsvikter för avvikelsedetektering. Med tanke på att den föreslagna minnesmodulen är universell och inte har något att göra med kodarens struktur och struktur. avkodare, kommer den att integreras i en mer komplex grundmodell och användas i experiment på mer utmanande datamängder.

cistanche—Improve memory4

Cistanche-tillägg nära mig - Förbättra minnet

Referenser

[1] F. Dong, Y. Zhang och X. Nie, "Dual discriminator generative adversarial network for video anomaly detection," IEEE Access, vol. 8, s. 88170–88176, 2020.

[2] K. Doshi och Y. Yilmaz, "Any-shot sequential anomaly detection in surveillance videos," i Proceedings of the CVPRW, s. 934-935, Seattle, WA, USA, juni 2020.

[3] K. Doshi och Y. Yilmaz, "Continual learning for anomaly detection in surveillance videos," i Proceedings of the CVPRW, s. 254-255, Seattle, WA, USA, juni 2020.

[4] K. Jayanta, "Dutta och bonny Banerjee. Online-detektion av onormala händelser med hjälp av inkrementell kodningslängd," i Proceedings of the AAAI, s. 3755–3761, Austin, Texas, USA, januari 2015.

[5] Y. Feng, Y. Yuan och X. Lu, "Lärande djupa händelsemodeller för upptäckt av publikavvikelser," Neurocomputing, vol. 219, s. 548–556, 2017.

[6] D. Gong, L. Liu, V. Le et al., "Memorera normalitet för att upptäcka anomali: minnesförstärkt djup autokodare för oövervakad anomalidetektion", i Proceedings of the ICCV, s. 1705–1714, Seoul, Korea, oktober 2019.

[7] M. Ravanbakhsh, M. Nabi, E. Sangineto, L. Marcenaro, C. Regazzoni och N. Sebe, "Onormal händelsedetektering i videor som använder generativa motstridiga nät," i Proceedings of the IEEE International Conference on Image Processing , s. 1577–1581, Peking, Kina, september 2017.

[8] M. Hasan, J. Choi, J. Neumann, AK Roy-Chowdhury och LS Davis, "Learning temporal regularity in video sequences," i Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, s. 733– 742, Las Vegas, NV, USA, juni 2016.

[9] W. Liu, W. Luo, D. Lian och S. Gao, "Future frame prediction for anomaly detection–a new baseline," i Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, s. 6536– 6545, Salt Lake City, UT, USA, juni 2018.

[10] H. Park, J. Noh och B. Ham, "Learning memory-guided normality for anomaly detection," i Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, s. 14 372–{{ 3}}, Seattle, WA, USA, juni 2020.

[11] MZ Zaheer, J.-h. Lee, M. Astrid och S.-I. Lee, "Old is gold: redefiniing the adversarially learned one-class classifier training paradigm", i Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, s. 14 183–214 193, Seattle, WA, USA, juni 2020.

[12] X. Zhu, J. Liu, J. Wang, Y. Fang och H. Lu, "Anomalidetektering i den fullsatta scenen via gemensamma modellering av utseende och dynamik," i Proceedings of the IEEE International Conference on Image Processing, s. 2705–2708, Melbourne, VIC, Australien, september 2013.

[13] RVHM Colque, CAC J´unior och WR Schwartz, "Histograms of optical fellow orientation and magnitude to detect anomalous events in videos," i Proceedings of the Sibgrapi Conference on Graphics, Patterns, and Images, s. 126–133 , Salvador, Bahia, Brasilien, augusti 2015.

[14] Bo Zong, S. Qi, RM Martin, et al., "Deep autoencoding Gaussian mix model for unsupervised anomaly detection," i Proceedings of the International Conference on Learning Representations, Vancouver, Kanada, april 2018.

[15] M. Sabokrou, M. Fayyaz, M. Fathy, Z. Moayed och R. Klette, "Djup-anomali: helt konvolutionellt neuralt nätverk för snabb avvikelsedetektering i trånga scener," Computer Vision and Image Understanding, vol. 172, s. 88–97, 2018.

[16] C. Li, Z. Han, Q. Ye och J. Jiao, "Detektering av visuellt onormalt beteende baserat på gles rekonstruktionsanalys," Neurocomputing, vol. 119, nr. 7, s. 94–100, 2013.

[17] V. Mahadevan, W. Li, V. Bhalodia och N. Vasconcelos, "Anomaly detection in crowded scenes," i Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), s. 1975–1981, IEEE, San Francisco, CA, USA, juni 2010.

[18] W. Li, V. Mahadevan och N. Vasconcelos, "Anomalidetektering och lokalisering i trånga scener," IEEE Transactions on Pattern Analysis and Machine Intelligence, vol. 36, s. 18–32, 2014.

[19] Y. Zhao, B. Deng, C. Shen, Y. Liu, H. Lu och X.-S. Hua, "Spatio-Temporal AutoEncoder for video anomaly detection," i Proceedings of the ACM International Conference on Multimedia (ACM MM), s. 1933–1941, ACM, Mountain View California USA, oktober 2017.

[20] W. Luo, L. Wen och S. Gao, "A revisit of sparse coding based anomaly detection in stacked RNN framework," i Proceedings of the IEEE International Conference on Computer Vision (ICCV), Venedig, Italien, oktober 2017.

[21] W. Luo, L. Wen och S. Gao, "Remembering history with convolutional LSTM for anomaly detection," i Proceedings of the IEEE International Conference on Multimedia and Expo (ICME), s. 439–444, IEEE, Hong Kong, juli 2017.

[22] Y. Chang, Z. Tu, W. Xie och J. Yuan, "Clusterdriven deep autoencoder for video anomaly detection," i Proceedings of the European Conference on Computer Vision (ECCV), s. 329–345, Springer, Glasgow, Storbritannien, augusti 2020.

[23] L. Wen, W. Luo, D. Lian och S. Gao, "Future frame prediction for anomaly detection – a new baseline," i Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pp. . 6536–6545, IEEE, Salt Lake City, UT, USA, juni 2018.

[24] M. Song, "A mean field view of the landscape of two-layer neural networks," Proceedings of the National Academy of Sciences, vol. 115, nr. 33, s. E7665–E7671, 2018.

[25] B. Ding och G. Wen, "Sparsity constraint nearest subspace classifier för måligenkänning av SAR-bilder," Journal of Visual Communication and Image Representation, vol. 52, s. 170–176, 2018.

[26] T. Wang och H. Snoussi, "Detektering av onormala visuella händelser via globalt optiskt orienteringshistogram," IEEE Transactions on Information Forensics and Security, vol. 9, nr. 6, s. 988–998, 2014.

Du kanske också gillar