Utforska självövervakade syntransformers för gångigenkänning i det vilda del 1

Nov 24, 2023

Abstrakt:

Sättet att gå (gång) är en kraftfull biometrisk som används som en unik fingeravtrycksmetod, som gör att diskreta beteendeanalyser kan utföras på avstånd utan ämnessamarbete.

Vi vet alla att träning bidrar till god hälsa. Utöver detta hjälper träning också till att förbättra minnet. Att gå är den enklaste och lättaste träningsformen att träna, och många tycker om att koppla av medan de går eller joggar. Nu visar mer forskning att promenader gör kraftfulla saker för hjärnan.

För det första stimulerar promenader hjärnans nervsystem, vilket hjälper till att stärka hjärnans funktion. När kroppen rör sig ökar vår hjärtfrekvens och blodflöde, vilket också stimulerar hjärnan att producera fler neuroner och synapser. Kopplingarna mellan dessa neuroner och synapser kan skapa nya neurala nätverk och snabbare tankeprocesser.

För det andra kan promenader lindra stress och ångest, vilket är mycket viktigt för att förbättra minnet. När sinnet och kroppen är i ett tillstånd av spänning, depression eller ångest, frisätter hjärnan ett hormon som kallas kortisol. Kortisol skadar nervceller och synapser i hjärnan, vilket kan leda till minnesförlust. Promenader lindrar stress och ångest, minskar kortisolproduktionen i kroppen och hjälper till att upprätthålla friska nervceller och synapser.

Slutligen ökar promenader blodcirkulationen till hjärnan. Vissa studier visar att god blodcirkulation kan bidra till att förbättra minnet. När vi åldras blir blodkärlen i hjärnan gradvis igensatta, vilket resulterar i otillräcklig syretillförsel till hjärnan. Promenader kan förbättra hjärtats hälsa, vilket gör att hjärtat kan leverera syre och näringsämnen till hjärnan mer effektivt, vilket främjar minne och hjärnfunktion.

Därför är promenader en fantastisk träningsform för både unga och gamla. Förutom att förbättra den fysiska hälsan kan promenader också bidra till att förbättra minnet. Låt oss gå en sträcka varje dag för att göra oss friskare och bättre! Det kan ses att vi behöver förbättra minnet, och Cistanche deserticola kan förbättra minnet avsevärt eftersom Cistanche deserticola är ett traditionellt kinesiskt läkemedelsmaterial som har många unika effekter, varav en är att förbättra minnet. Effekten av malet kött kommer från de olika aktiva ingredienserna det innehåller, inklusive syra, polysackarider, flavonoider, etc. Dessa ingredienser kan främja hjärnans hälsa på olika sätt.

improve memory

Klicka på vet 10 sätt att förbättra minnet

Till skillnad från mer traditionella biometriska autentiseringsmetoder, kräver gånganalys inte explicit samarbete mellan motivet och kan utföras i lågupplösta inställningar utan att kräva att motivets ansikte är fritt fram/synligt. De flesta nuvarande tillvägagångssätt är utvecklade i en kontrollerad miljö, med rena, guldstandard kommenterade data, som drev utvecklingen av neurala arkitekturer för igenkänning och klassificering.

Först nyligen har gånganalys vågat sig på att använda mer mångsidiga, storskaliga och realistiska datauppsättningar till förtränade nätverk på ett självövervakat sätt. Självövervakad träningsregim möjliggör inlärning av olika och robusta gångrepresentationer utan dyra manuella mänskliga anteckningar. Med anledning av den allestädes närvarande användningen av transformatormodellen inom alla områden av djupinlärning, inklusive datorseende, undersöker vi i detta arbete användningen av olika syntransformatorarkitekturer som direkt tillämpas på självövervakad gångigenkänning.

Vi anpassar och tränar om de enkla ViT, CaiT, CrossFormer, Token2Token och TwinsSVT på två olika storskaliga gångdataset: GREW och DenseGait. Vi tillhandahåller omfattande resultat för nollskott och finjustering av två benchmark-gångsigenkänningsdatauppsättningar, CASIA-B och FVG, och utforskar sambandet mellan mängden rumslig och tidsmässig gånginformation som används av den visuella transformatorn.

Våra resultat visar att design av transformatormodeller för bearbetning av rörelse använder ett hierarkiskt tillvägagångssätt (dvs. CrossFormer-modeller) på finkorniga rörelsemässor jämförelsevis bättre än tidigare helskelettmetoder.

Nyckelord:

gångigenkänning; biometrisk autentisering; vision transformator; ställningsuppskattning; självkontrollerat lärande; kontrastiv inlärning.

1. Introduktion

Hur vi rör oss innehåller viktiga ledtrådar om oss själva. I synnerhet har vår gång (sätt att gå) studerats noggrant inom medicin [1], psykologi [2] och idrottsvetenskap [3]. På senare tid har gånganalys fått ökad uppmärksamhet [4,5] från datavetenskapssamhället, vilket sammanfaller med den exponentiella utvecklingen av djupinlärning och utbredd tillgänglighet av datorhårdvara.

AI-drivna gånganalyssystem har framgångsrikt kunnat känna igen ämnen [6–10], uppskatta demografi som kön och ålder [11] och uppskatta externa attribut som kläder [12], utan att använda några externa utseendesignaler. Dessa resultat är inte överraskande, med tanke på den stora mängden individuella skillnader i gång, som beror på skillnader i muskuloskeletala struktur, genetiska och miljömässiga faktorer, såväl som vandrarens känslomässiga tillstånd och personlighet [13].

Nuvarande system är bara riktigt tränade och testade i kontrollerade inomhusmiljöer. De flesta metoder använder CASIA-B-datauppsättningen [6] som standardriktmärke för gångidentifieringsmodeller, som innehåller 124 försökspersoner som går inomhus på ett strikt kontrollerat sätt som fångats med flera kameror. Komplexiteten i den verkliga världen kan inte helt modelleras av sådana återhållsamma scenarier. Först nyligen har fokus legat på modellering av gång "i det vilda", med datauppsättningar som DenseGait [12], GREW [7] och Gait3D [14].

short term memory how to improve

Att samla in en storskalig datauppsättning som är ren och helt kommenterad representerar en enorm ansträngning både vad gäller ekonomiska resurser och allokerad tid. GREW-datauppsättningen [7] tog enligt uppgift tre månaders kontinuerligt arbete att samla in och kommentera. Även om sådana tillvägagångssätt har varit användbara för att utveckla neurala arkitekturer för bearbetning av gång [8,9], är de inte tillräckligt olika för att kunna användas korrekt i mer avslappnade, verkliga miljöer.

AI-gemenskapen har långsamt rört sig bort från detta tillvägagångssätt inom andra områden, med metoder för självövervakad inlärning för både syn [15] och språk [16] som fått betydande dragkraft och ofta överträffat traditionella övervakade metoder. Nyligen framsteg i självövervakat lärande visade att självövervakade modeller är mer robusta och uppvisar framväxande beteenden, inte uttryckligen definierade under träning.

Till exempel, DINO [17], en syntransformator utbildad i en självövervakad regim, lärde sig klassspecifika egenskaper som möjliggör oövervakad objektsegmentering utan att använda några sådana etiketter under träningen. Cosmaand Radoi [10] föreslog den första kontrastiva metoden för självövervakad inlärning för gånganalys, genom att träna en ST-GCN [18] på en mindre version av DenseGait [12]. Deras metod gav rimliga resultat på nedströms gångigenkänningsuppgifter och visade att det finns en stark korrelation mellan den förtränade datasetstorleken och nollskottsöverföringsprestanda.

Medan många tillvägagångssätt för gånganalys har använt silhuetter som extraherats från bakgrundssubtraktion [6,8,9], innebär att extrahera silhuetter i verkliga övervakningsscenarier användningen av mer avancerade tekniker, såsom instanssegmentering [19], vilket medför en hög beräkningskostnad. Sekvenser av silhuetter upptar betydande lagringsutrymme och är inte tillräckligt flexibla för att användas i andra närliggande uppgifter, såsom aktivitetsigenkänning. Dessutom kodar silhuetter subtila tecken på utseende, vilket gör det oklart i vilken utsträckning rörelse används i identifieringen [20].

Å andra sidan har 2D-positestimeringsmodeller blivit allt mer exakta och beräkningseffektiva [21,22]. Skelett är billiga att extrahera och för närvarande mer tillförlitliga än 3D-maskor och 3D-poser, särskilt på avstånd. Dessutom är 2D-skelett betydligt lättare än silhuetter när det gäller långtidslagring.

Nuvarande arkitekturer för bearbetning av sekvenser av skelett använder den naturliga grafstrukturen som finns i det mänskliga skelettet, vilket introducerar en induktiv förspänning i modelldesignen. Modeller som den populära ST-GCN [18] och MS-G3D [23] har sett imponerande resultat för skelettbaserad handlingsigenkänning.

Samtidigt har det skett en explosion i användningen av transformatormodeller inom nästan alla områden av djupinlärning sedan deras första tillämpning för naturlig språkbehandling.

Transformatorer anses vara en mer allmän arkitektur, med få induktiva förspänningar. Inledningsvis har transformatorer kämpat för att matcha CNN-modeller för bildklassificering [24], men de överträffar för närvarande andra modeller och visar lovande resultat i självövervakade scenarier, mer än andra typer av arkitekturer, transformatorer har visat imponerande inlärningskapacitet och framväxande beteenden under sig själv. -övervakning [17].

Cosma och Radoi [12] var de första som föreslog GaitFormer, en direkt anpassning av visiontransformatorns kodarmodell för gångidentifiering, med användning av individuella skelett som inmatade "lappar", som i huvudsak bara utför tidsmässig uppmärksamhet, ignorerar rumsliga uppmärksamhetsförhållanden.

GaitFormer tränades på ett självövervakat sätt och överträffade andra gångigenkänningsmetoder även utan någon finjustering. Sådant tidigare arbete är uppmuntrande och banar väg för en mer djupgående studie av den potentiella tillämpningen av transformatorarkitekturer för gånganalys. Kan syntransformatormodeller anpassas för självövervakad inlärning av skelettgångsrepresentationer?

Den främsta arkitektoniska frågan i syntransformatorer är att definiera de korrekta förhållandena mellan bildlappar, som definierar lokal och global information. När det tillämpas på gång, motsvarar valet av lappdimensioner mängden kodad tids- och rumsinformation i skelettsekvensen.

I detta arbete presenterar vi en omfattande studie av fem olika syntransformatorer, anpassade för gångigenkänning. Vi utforskar den klassiska ViT-modellen [24], CaiT [25], CrossFormer [26], TwinsSVT [27] och token-to-token ViT [28].

ways to improve memory

Varje arkitektur tränas separat på ett kontrastivt självövervakat sätt på två storskaliga "in the wild" dataset med 2D-gångskelettsekvenser: DenseGait – en automatiskt insamlad datauppsättning från rawsurveillance-strömmar och GREW, en mindre datauppsättning som innehåller rena mänskliga kommentarer.

Vi utforskar överföringsmöjligheter över två kontrollerade datamängder för gångigenkänning, CASIA [6] och FVG [29]. För varje datamängd analyserar vi direkt (zero-shot) överföring och dataeffektivitet under finjustering genom att träna med progressivt större delmängder av datamängderna. Dessutom genomför vi en ablationsstudie om förhållandet mellan rumsliga och tidsmässiga dimensioner för lappstorlekar för SimpleViT och CaiT , standardryggraden för de flesta visionstransformatorer hittills.

Resten av tidningen är organiserad enligt följande. Vi genomför en översikt på hög nivå av relaterade arbeten om gångidentifieringsmodeller och syntransformatorer. Vi observerar att gångrepresentationsmodeller har stor nytta av självövervakad träning för att ha mer robusta och generella inbäddningar, och transformatormodeller har visat stor modelleringskapacitet i självövervakade träningsregimer.

Vidare beskriver vi matematiskt de fem arkitekturerna som vi benchmarkerar och beskriver dataförbehandlingen och skeletttransformationerna som måste utföras, så att visiontransformatorer måste fungera sömlöst på skelettsekvenser. Vi beskriver också dataförstärkningar, utbildnings- och benchmarkingdatauppsättningar och experimentella inställningar.

Vi visar upp resultat på CASIA-B och FVG för var och en av de fem arkitekturerna och de två datauppsättningarna "förträning i naturen". Slutligen gör vi en ablationsstudie om förhållandet mellan de rumsliga och temporala lappstorlekarna och ger en kort diskussion om våra resultat. Vi gör vår källkod offentligt tillgänglig på GitHub (https://github.com/cosmaadrian/gait-vit, tillgänglig den 28 februari 2023) för transparens och reproducerbarhet.

2. Relaterat arbete

I det här avsnittet gör vi en kort översikt över befintliga metoder för gångidentifiering i okontrollerade miljöer och "i det vilda". Vidare beskriver vi huvudsakligen utvecklingen av transformatormodeller och i synnerhet deras tillämpning inom visiondomänen.

2.1. Gångigenkänning

På samma sätt som ansiktsbaserad identifiering bygger gångigenkänning på metrisk inlärning. Till skillnad från traditionella biometriska autentiseringsmetoder, som förlitar sig på en enda bild (t.ex. ansiktsigenkänning) och kräver omfattande samarbete (t.ex. irisbaserad biometrisk autentisering), bearbetas gångfunktioner som en sekvens av ögonblicksbilder av rörelse. Sådan gestdynamik kräver mer komplexitet för att bestämma den mest informativa delsekvensen men möjliggör användning av diskret autentisering på avstånd.

I det här sammanhanget innebär uppgiften att träna ett kodarnätverk för att kartlägga gångsekvenser till ett inbäddningsutrymme där inbäddningslikheten motsvarar likheten i gång. Inbäddningar av promenader som tillhör samma person bör ligga nära inbäddningsutrymmet och de som kommer från olika identiteter behöver vara mer avlägset. I detta inbäddningsutrymme kan man dra slutsatser genom att erhålla inbäddningen av gångsekvensen och utnyttja den närmaste granne tillvägagångssätt på en databas över kända promenader.

Nuvarande tillvägagångssätt inom gångbaserad igenkänning är indelade i två kategorier: utseendebaserad [8,9] och modellbaserad [10,12,30]. Utseendebaserade metoder erhåller först silhuetterna av de gående motiven med bakgrundssubtraktion eller segmenteringsalgoritmer från varje videobildruta.

Sedan matas sekvensen av silhuetter in i CNN-baserade arkitekturer som extraherar rumsliga och tidsmässiga egenskaper som aggregeras till en slutlig inbäddning för igenkänning. Modellbaserade tillvägagångssätt extraherar skeletten från RGB-videor med poseestimationsmodeller [21,22]. Sekvenser av skelett bearbetas vanligtvis av modeller som är beroende av graffalsningar [10,30] för att erhålla inbäddningen av gång.

GaitSet, arbetet av Chao et al. [8], betraktar gången som en oordnad uppsättning silhuetter. Författarna hävdar att denna representation är mer flexibel än en siluettsekvens eftersom den är robust för olika arrangemang av ramar eller kombinationen av flera gångriktningar och variationer. De använder faltningslager för varje siluett för att erhålla funktioner på bildnivå och kombinera dem till en funktion på fast nivå med Set Pooling. De får den slutliga produktionen genom att använda sin version av HorizontalPyramid Matching [31].

Fan et al. [9] märkte det faktum att specifika delar av den mänskliga silhuetten borde ha sitt rumsliga uttryck eftersom var och en har ett unikt mönster. Deras arkitektur, GaitPart, använder focal convolution lager (FConvs), som är en specialiserad typ av faltning med ett mer begränsat receptivt fält. Författarna hävdar att FConvs hjälper deras arkitektur att lära sig mer finkorniga funktioner för olika delar av den rörliga kroppen. De introducerar också mikrorörelsefångstmodulerna, som används för att extrahera funktionerna i små tidssekvenser.

Teepe et al. [30] föreslår GaitGraph, som utnyttjar ett anpassat graffaltningsnätverk som kallas ResGCN [32] för att koda de spatiotemporala egenskaperna som erhålls från sekvensen av skelett. Li et al. [33] föreslår PTP, som är en struktur som samlar flera temporala egenskaper från en gångcykel baserat på deras analys av de viktigaste stadierna av gång.

De använder också ett graffalsningsnätverk för rumslig funktionsextraktion, som fungerar tillsammans med PTP. Författarna introducerar en ny dataförstärkningsmetod som modifierar gångarten så att den har flera steg i en mer realistisk cykel.

Men, till skillnad från tidigare arbeten, siktar vi på att utforska prestanda för arkitekturer för gångidentifiering i självövervakade scenarier. Inspirerade av enorma framsteg inom datorseendedomänen, föreslår vi att anpassa befintliga visiontransformatorarkitekturer för att fungera på skelettsekvenser istället för bilder och att testa deras modelleringskapacitet i självövervakade scenarier. De flesta andra verk [8,9,30] fokuserar sina ansträngningar på att utveckla neurala arkitekturer som uppnår imponerande resultat på gångigenkänning på kontrollerade datamängder.

Vi avser dock att ta bort behovet av mycket dyra manuella anteckningar för gångdatauppsättningar och utforska sätt på vilka självövervakad inlärning är lämplig för gånganalys.

memory enhancement

Tidigare arbeten inom denna domän [10,12] visade potential för att lära sig bra gångrepresentationer från svagt kommenterade datamängder. Cosmaand Radoi [12] föreslog GaitFormer, den första transformatorbaserade arkitekturen för bearbetning av skelettsekvenser, inspirerad av ViT [24]-modellen. I likhet med [12] försöker vi utforska prestandan hos andra visiontransformatormodeller, med olika rums- och tidsdynamik i patchbearbetningsmekanismen. Storskaliga datauppsättningar för gångigenkänning har föreslagits tidigare [7,12], vilket möjliggör utveckling av allmänna arkitekturer för representationsinlärning.


For more information:1950477648nn@gmail.com


Du kanske också gillar