Utforska självövervakade syntransformers för gångigenkänning i The Wild del 2

Nov 24, 2023

2.2. Vision Transformers

Även om transformatorer ursprungligen föreslogs för NLP-uppgifter [16,34] med enorm framgång, har transformatorer blivit allmänt använda i datorseende de senaste åren [24,25,28,35–37]. Båda domänerna har haft oöverträffade prestanda genom att använda olika varianter av transformatorer, delvis på grund av den ökade modellkapaciteten och transformatorernas förmåga att dra nytta av självövervakning mycket mer än tidigare modeller [17].

Självövervakning och minne är nära besläktade. Självövervakning hänvisar till utvärdering och justering av ens beteende, tänkande och känslor, medan minne hänvisar till förmågan att förvärva, bearbeta och lagra information. Självövervakning kan hjälpa oss att få bättre kontroll över vårt beteende och våra känslor och därigenom förbättra minnet.

För det första kan egenkontroll hjälpa oss att bättre motstå frestelser. Frestelser tenderar att distrahera vår uppmärksamhet och energi och påverka vårt minne. Genom självövervakning kan vi bättre kontrollera oss själva och undvika överdrivna distraktioner, och därigenom förbättra minnet.

För det andra kan egenkontroll också hjälpa oss att bättre förstå och komma ihåg information. Självövervakning gör att vi kan ägna mer uppmärksamhet åt informationens nyckelpunkter och uppmärksamma sambanden mellan information, för att bättre förstå och komma ihåg information. När vi är uppmärksamma är vi bättre rustade att förstå och behålla information.

Slutligen kan egenkontroll också hjälpa oss att bättre observera och sammanfatta vårt beteende och tänkande. Genom att reflektera över våra egna handlingar och tankeprocesser kan vi identifiera brister och förbättra dem. Denna förbättring förbättrar inte bara vårt beteende och tänkande utan förbättrar också vår minnesförmåga.

Sammanfattningsvis är självövervakning och minne nära besläktade. Genom egenkontroll kan vi bättre kontrollera oss själva, bättre förstå och komma ihåg information och bättre förbättra vårt beteende och tankeprocesser. Samtidigt kommer detta också att hjälpa oss att förbättra vårt minne, vilket gör att vi kan studera och arbeta mer effektivt. Låt oss förtydliga våra mål, anpassa oss aktivt och ständigt sträva efter framsteg! Det kan ses att vi behöver förbättra minnet, och Cistanche deserticola kan förbättra minnet avsevärt, eftersom Cistanche deserticola också kan reglera balansen av signalsubstanser, som att öka nivåerna av acetylkolin och tillväxtfaktorer. Dessa ämnen är mycket viktiga för minne och inlärning. Dessutom kan Kött också förbättra blodflödet och främja syretillförseln, vilket kan säkerställa att hjärnan får tillräckligt med näringsämnen och energi, och därigenom förbättra hjärnans vitalitet och uthållighet.

supplements to boost memory

Klicka på vet kosttillskott för att förbättra minnet

Dosovitskiy et al. [24] var de första som föreslog användning av transformatorkodare för bildklassificering, och introducerade Vision Transformer (ViT). Arkitekturen delar in ingångsbilden i lappar med fast storlek på 16x16, plattar till och projicerar dem med ett linjärt lager till inbäddningsdimensionen. En extra klasstoken (CLS) infogas i sekvensen och positionskodningar läggs till varje vektor.

Den resulterande sekvensen av inbäddning ges som input till en transformatorkodare, som har samma struktur som den i [34] men använder LayerNorm-operatorn före varje block istället för efter (pre-norm). Ett MLPhead används för att erhålla klassetiketten från den globalt aggregerade informationen i klasstoken.

Självuppmärksamhetsmekanismen introducerad av Vaswani et al. [34] tar en sekvens av objekt som indata och uppskattar interaktionen mellan dem alla genom att aggregera den globala informationen för varje element i sekvensen. För att beräkna olika interaktioner mellan elementen i en sekvens, sammanfogar multi-head self-attention (MSA)-modulen resultaten av flera självuppmärksamhetsblock och projicerar resultatet på en inlärbar viktmatris. Transformatorkodaren som introduceras i [34] är sammansatt av flera staplade lager bestående av ett MSA-block, ett framkopplingsblock (FFN), kvarvarande anslutningar mellan varje block och en LayerNorm (LN) efter varje block.

Touvron et al. [25] föreslår två arkitektoniska förändringar för att förbättra prestandan hos transformatorer för djupsyn. Deras första bidrag, LayerScale, underlättar träningen av djupare modeller genom att lägga till en inlärbar diagonal matris som multipliceras med utdata från restblocken. Eftersom matrisen initieras med små värden, tvingar den resultaten av transformatorkodarskikten att ha ett litet bidrag till utmatningen av restblocket i början av träningen.

Deras andra bidrag är klassuppmärksamhetsmekanismen. Istället för att initialt lägga till CLS-token, som i standard ViT, läggs den till efter flera kodarblock. Efter det här steget uppdateras endast klasstoken och patch-token hålls frysta. Denna mekanism hjälper till att frikoppla självuppmärksamhetsoperationerna mellan patchar från aggregering av informationen som kommer att användas för klassificering.

Yuan et al. [28] hävdar att den enkla tokeniseringen av fläckar i vanilj ViT har begränsningen att inte kunna modellera bildens lokala struktur och interaktionen mellan närliggande fläckar. Följaktligen introducerar de en progressiv tokeniseringsprocess som kombinerar angränsande tokens till en enda.

Denna process består av Reshape-modulen, som tar sekvensen av tokens från föregående lager och konstruerar en bild från dem baserat på rumslig närhet. Soft Split-modulen delar upp den konstruerade bilden i överlappande fläckar av tokens och matar dem till nästa kodare. De genererade tokens efter tokeniseringsprocessen matas in i en djup narrowViT-ryggrad för klassificering.

ways to improve your memory

Såsom noterats av Wang et al. [35] standard Vision Transformer designades specifikt för bildklassificering och är inte lämpad för andra uppgifter som segmentering av objektdetektering. På grund av detta föreslår de Pyramid Vision Transformer (PVT) som tar inspiration från CNN-arkitekturer genom att producera intermediära funktionskartor med minskande rumsliga dimensioner och ett ökande antal kanaler.

Denna pyramidstruktur hjälper modellen att lära sig flerskaliga funktioner som kan användas för olika uppgifter. Modellen bearbetar först tokens erhållna från lappar med dimensionerna 4 × 4, och i varje steg motsvarar lapparna större rumsliga dimensioner av lappar.

Beräkningskostnaden för klassisk självuppmärksamhet är O(N2·d) där N är antalet tokens i sekvensen och d är vektordimensionen. Den kvadratiska beräkningskostnaden i termer av antalet tokens blir ett praktiskt problem med att öka indatabildens upplösning eftersom varje token i en sekvens motsvarar en lapp i bilden.

I litteraturen finns det flera tekniker för att minska beräkningskostnaden för vaniljs självuppmärksamhet [26,35,36]. PVT [35] använder spatial reduktions uppmärksamhet, vilket minskar den rumsliga storleken på nyckel- och värdevektorerna före självuppmärksamheten med en omformningsoperation och en linjär projektion.

Swin-transformatorn [36] som också har en pyramidstruktur ersätter självuppmärksamhetsblocket med en modul som approximerar det. Modulen grupperar angränsande patchar i lokala fönster och utför självuppmärksamhet endast i dessa fönster.

För att kommunicera informationen med andra fönster, skiftar det de lokala fönstren så att de också innehåller patchar från angränsande fönster och beräknar självuppmärksamhet igen. Chu et al. [27] antog PVT-arkitekturen och föreslog en liknande metod för att approximera självuppmärksamhet. De gjorde också lokal uppmärksamhet mellan patchar i ett fönster, liknande Swin-transformatorn.

För att kommunicera information med andra fönster genomförde de självuppmärksamhet mellan en representant för varje fönster och alla andra fönster. CrossFormer [26] bygger också på PVT. Den använder uppmärksamhet på kort avstånd, som liknar den lokala uppmärksamheten i Swin-transformatorn, men för att läcka information till andra fönster använder den uppmärksamhet på långa avstånd, som beräknar interaktionen mellan patchar, som har ett fast avstånd mellan dem. Den kombinerar också flerskaliga patchar centrerade runt samma pixel för att erhålla tokens för transformatorblocken, vilket hjälper modellen att lära sig interaktioner över skala.

Yang et al. [37] föreslår den fokala uppmärksamhetsmekanismen för att lära sig interaktioner på både korta och långa avstånd mellan tokens, vilket gör att syntransformatorer kan bearbeta högupplösta bilder. För varje bildlapp beräknar den fokala självuppmärksamhetsmodulen interaktioner med rumsligt slutna lappar och med sammanfattade fönster av lappar som är längre bort. Sammanfattningen av fönster av lappar görs via pooling och det fångar in information när lapparna är långt borta.

RegionViT [38] använder PVT-arkitekturen och lägger till två tokeniseringsvägar för varje funktionskarta. Den första tokeniseringsvägen erhåller regionala tokens som består av patchar som täcker ett stort antal pixlar. Den andra tokeniseringsvägen erhåller lokala tokens som fångar information på låg nivå genom att innehålla få pixlar. Dessa två typer av tokens matas som indata till den regional-till-lokala transformatorkodaren i vilken första självuppmärksamhet mellan regioner beräknas, sedan mellan varje regional token och dess motsvarande lokala token.

LeViT-arkitekturen [39] kombinerar både CNN och självuppmärksamhetsmekanismen. En bild matas först in i en CNN-kodare, vilket minskar de rumsliga dimensionerna och ökar kanaldimensionen. De resulterande särdragskartorna matas in i en hierarchicalViT som innehåller en krympande uppmärksamhetsmodul mellan dess kodare för att ytterligare minska de rumsliga dimensionerna och öka kanaldimensionen för särdragskartorna.

Arkitekturer baserade på uppmärksamhet har också använts i videobaserade uppgifter där tidsinformation måste beaktas. Arkitekturer, såsom ViViT [40] och TimeSformer [41], använder självuppmärksamhetsmekanismen över både de rumsliga och de tidsmässiga dimensionerna. På grund av detta lär sig modellen att fånga den rumsliga informationen från varje bildruta och förändringen över tid.

3. Metod

I det här avsnittet ger vi en detaljerad beskrivning av varje arkitektur och valda hyperparametrar. Vidare beskriver vi databehandlingen och de föreslagna designbesluten för att anpassa syntransformatorer för att fungera med skelettsekvenser. Slutligen beskriver vi initialiseringsmetoderna, utvärderingsprotokollet och utvärderingsdatauppsättningarna.

3.1. Beskrivning av arkitektur

Vi utforskade fem olika varianter av Vision Transformers (Figur 1), som utvecklades för mer optimerad beräkning av bilder, när det gäller nedströmsprestanda och slutledningstid. I synnerhet utforskar vi klassiska ViT [24], CaiT [25], Token2Token ViT [28] och Twins-SVT [27].

Generellt handlar smakerna av visiontransformatorer om förbättringar av det "klassiska" sättet att bearbeta bilder med transformatorer, som föreslagits i ViT: bilder delas upp i lika stora och icke-överlappande fläckar som tillplattas och projiceras i ett utrymme med lägre dimensioner för att behandlas sedan som "tokens", på liknande sätt som NLP-applikationer. När det gäller gånganalys motsvarar en fyrkantig lapp en grupp leder som varierar över ett litet tidsfönster.

increase brain power

Standardtransformatorkodaren tar som indata en sekvens av objekt (X ∈ Rn×d där—antal objekt, d—inbäddningsdimension) och projicerar dem på tre olika inlärningsbara viktmatriser och erhåller frågorna (Q ∈ Rn×dq), nycklarna (K ∈ Rn×dk, dk=dq), och värden (V ∈ Rn×dv ), där dq, dk och dv är dimensionerna för frågorna, nycklarna respektive värdena. Uppmärksamhet beräknas som:

increase memory power

För de flesta arkitekturer fixade vi antalet lager, uppmärksamhetshuvuden och funktionsdimensionaliteter när det var möjligt. Som sådan väljer vi 4 lager med 4 uppmärksamhet headseach, en dimension på 512 för feedforward-nätverket och en slutlig inbäddningsstorlek på 128.

improve brain

ViT Vision Transformer [24] erhåller en inmatningssekvens av tokens genom att dela upp bilden i patchar och linjärt projicera dem till inbäddningsdimensionen. Den resulterande sekvensen tillsammans med en extra klasstoken (CLS) ges som indata till en transformatorkodare. Dessutom använder ViT-kodaren pre-norm, i motsats till post-normalisering. Utdata från ett lager kan beräknas som:

improve short term memory

där λl, i och λ0l, är inlärbara parametrar. Modellen frikopplar också beräkningen av interaktioner mellan indatatokens från beräkningen av klassinbäddningen som aggregerar all global information. Detta görs med klassuppmärksamhet som introducerar CLS-token till inmatningssekvensen efter att interaktionerna har erhållits och fryser alla andra tokens. För CaiT-kodaren använde vi samma konfiguration som i ViT, men för CLS-kodaren använde vi ett djup på 2 lager.

Token2Token ViT Token2Token-arkitekturen [28] innehåller en progressiv tokeniseringsprocess som modellerar den lokala strukturen för en bild genom att kombinera angränsande tokens. Tokeniseringsprocessen konstruerar först en bildliknande struktur från en inmatningssekvens av tokens med hjälp av Reshape-modulen. Sedan delas bilden upp i överlappande fläckar av tokens via Soft Split-modulen (SS). Den resulterande utsignalen från tokeniseringsmodulen beräknas som:

increase memory

För Token2Token använde vi 2 lager med patchstorlekar på {2, 8} och {2, 4} för det första lagret och {4, 16} för det andra lagret.

Twins-SVT Twins-SVT [27]-arkitekturen ersätter det klassiska självuppmärksamhetsblocket med en modul som kallas spatiellt separerbar självuppmärksamhet (SA) som approximerar operationen. SSSA består av en lokalt grupperad självuppmärksamhet (LSA) som beräknar interaktion endast mellan tokens inom samma lokala fönster och den globala subsampled uppmärksamheten (GSA) som aggregerar global information genom att göra självuppmärksamhet mellan alla representanter för varje lokalt fönster beräknad genom att blanda in de närliggande tokens. Operationerna för aTwins-lagret kan skrivas som:

ways to improve brain function

För CrossFormer-kodaren använde vi dimensionerna {16, 32, 64, 128} för lagren, globala fönsterstorlekar på {4, 2, 2, 1}, lokal fönsterstorlek på 2, tvärinbäddningssteg på 2 och kors -inbädda kärnstorlekar av {{2, 4, 8, 16}, {2, 4}, {2, 4}, {2, 4}}.

3.2. Dataförbehandling

För både DenseGait- och GREW-datauppsättningar använder vi samma förbehandlingsprocedur. För varje extraherad och spårad skelettsekvens som innehåller 18 leder med x- och y-koordinater och en ytterligare konfidenspoäng, normaliserar vi först sekvensen genom att centrera på bäckenkoordinaterna (bäcken, bäcken) och genom att skala horisontellt och vertikalt, enligt mänskliga kroppsproportioner (dvs. avståndet mellan axlarna: |xR.axel − xL.axel| och avståndet från nacke till bäcken: |hals − ypelvis|). För varje koordinat (led, led) för var och en av de 18 lederna i COCO-positionsformatet tillämpar vi följande normaliseringsprocedur:

improve your memory

Genom normaliseringsprocessen elimineras skillnader mellan kameraupplösningar och motivets avstånd från kameran. Dessutom eliminerar vi utseendeinformation om höjd och bredd på ett motiv, som inte hänför sig till rörelseinformation. Detta steg liknar inriktningssteget i moderna ansiktsigenkänningsmodeller [42]. Dessutom använder vi också ett batchnormaliseringsskikt [43] i början av varje modell för att ytterligare normalisera den resulterande bilden.

Med tanke på den tidsmässiga dimensionen T (dvs. antal ramar) och skelettets rumsliga dimension J (dvs. antal leder), kodas naiva skelettsekvenser som bilder av form (T, J, 3), där, i vårt fall, T {{ 1}} och J=18.

improve memory

De flesta visiontransformatorer antar dock att bilderna är kvadratiska. Därför föreslår vi flera varianter av storleksändring av den rumsliga dimensionen så att bilden omvandlas till (T, T, 3), vilket motsvarar en artificiell ökning av antalet leder (se figur 2).

improving brain function


For more information:1950477648nn@gmail.com


Du kanske också gillar