Ny rumslig-temporal kontinuerlig teckenspråksigenkänning med hjälp av ett uppmärksamt nätverk med flera funktioner(2)
Jun 01, 2023
3.5. Sekvensinlärning
Sekvensinlärning Efter att ha fått resultaten från den rumsliga och tidsmässiga egenskapsextraktorn i form av en glansfunktion, måste vi ordna dem i en hel mening. Därför måste vi använda sekvensinlärning för att säkerställa att glansen lyckas bilda en bra mening. Den vanligaste metoden i den aktuella forskningen hänvisar till Bidirectional Long Short Term Memory (Bi-LSTM) och Connectionist temporal classification (CTC) [17,23] för problem som kan lösas med CTC och flera nya verk [17,23] föreslår CTC som en end-to-end-utbildningsprocess för CSLR.

Cistanche-extraktpulver
Klicka här för att se produkter från Cistanche
【Be om mer】 E-post:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692
Långt korttidsminne (LSTM) [44] är en variant av det återkommande neurala nätverket (RNN), och det används ofta i sekvensmodellering. LSTM modellerar utmärkt långsiktiga beroenden; den kan bearbeta hela sekvenser av indata och använda deras interna tillstånd för att modellera tillståndsövergångarna. Emellertid är nackdelen med dessa framåtriktade RNN:er att de dolda tillstånden endast lärs från en enkelriktad riktning. RNN producerar ett dolt tillstånd såsom beskrivs av ekvationen nedan efter att ha mottagit särdragssekvensen som indata.
ht=RNN(ht−1,ot),
där ht representerar det dolda tillståndet, där det initiala tillståndet h0 är en fast nollvektor och t är tidssteget. RNN används för att förutsäga teckenglansen enligt den rumsliga egenskapssekvensinmatningen.
Dessutom är SL-uppgifter ganska komplexa. Därför kräver den inte bara funktioner som tas emot från en envägskontext utan behöver också hjälp med användning av tvåvägsinformation för att lära sig förekomsten av ord som kommer före och efter de andra orden i meningen. Följaktligen använder vi Bi-LSTM [45] för att lära oss de komplexa dynamiska beroenden av bildsekvenser genom att omvandla dem med hjälp av rumsliga och tidsmässiga representationer till sekvenser av glansfunktioner. Enligt den tidigare angivna förklaringen kan Bi-LSTM-metoden utföra tvåvägsarbete med LSTM-metoden. Detta innebär att Bi-LSTM-metoden bättre kan klassificera sekventiell data. Beräkningen av Bi-LSTM som använder tvåvägs dolda tillstånd kan också ses som upprepade beräkningar av LSTM som bearbetas från framsidan till baksidan och sedan bakifrån till framsidan. Efteråt passerar det dolda tillståndet för varje tidssteg genom ett helt sammankopplat lager och ett softmax-lager [17].

Cistanche pulver
vid=W(ht plus b),
yt,j=e at,j ∑ke at,j ,
där b är en förspänningsvektor och y(t,j) representerar sannolikheten för etikett j vid tidssteg t. I vår TSL-uppgift är etikett j det ordförråd som erhålls från meningen. I praktiken förbättrar Bi-LSTM avsevärt mängden information som ett nätverk kan komma åt, vilket i sin tur förbättrar kontexten av information som är tillgänglig i algoritmen. Informationen innehåller kunskapen om vilket ord som kommer efter eller före den aktuella bildrutan i meningsegenskapssekvensinmatningen.
Bi-LSTM skickar dolda tillstånd som utdata till CTC-skiktet för varje tidssteg. Eftersom resultaten av denna Bi-LSTM inte uppmärksammar glansarrangemanget använder vi CTC för att hantera videosekvensmappning o={ot} T 0 t=1 för att producera ett tecken glanssekvens `={` i} IL =1 (L Mindre än eller lika med T) med ett bättre arrangemang. CTC används inom många områden, inklusive handskriftsigenkänning [46], taligenkänning [47] och teckenspråksigenkänning [17,23]. I den här domänen används den som en poängfunktion utan att anpassa in- och utdatasekvenserna. I CSLR är CTC känd som en modul utvecklad för end-to-end-uppgifter som involverar klassificering av tidsdata utan segmentering. Genom dynamisk programmering kan CSLR lösa inriktningsproblemet genom att skapa en tom etikett (-) som tillåter systemet att producera optimala resultat för representation av data som inte har etiketter (som epentesdata och segment av icke-gestdata). I synnerhet genererar CTC en tom etikett "-" för att utöka ordförrådet V, där V=Vorigin ∪ {-}. Syftet med denna tomma etikett är att representera övergången och att meddela förekomsten av ett blankt gloss som inte ger information för inlärningsprocessen, eftersom π={πt} T 0 t{{20 }}, där πt ∈ V. Som ett resultat kan CTC hantera utgångsparametrarna från den rumsliga och tidsmässiga egenskapsextraktorn och även Bi-LSTM som inriktningsmodul genom att sammanfatta sannolikheterna för alla möjliga vägar. Alla inriktningsvägar π har en sannolikhet som ges inmatningssekvensen enligt följande [17]:

Cistanche deserticola experiment
p(π| o) {{0}} T 0 ∏ t=1 p(πt|o)=T 0 ∏ t=1 yt, πt
I nästa steg definierar vi en mång-till-en-mappningsoperation B, som tar bort allt mellanslag och duplicerar ord från justeringsvägen. Till exempel, B (II-är- -en- -läkare)=Jag, är, en, läkare. Som ett resultat kan vi beräkna den villkorliga sannolikheten för teckenglanssekvensen l som summan av sannolikheterna för alla rutter som kan mappas till l från B, på det sätt som beskrivs nedan [17]:
p(π|o) = ∑ π∈B−1 p(π|o)
där B −1 (l)={π|B(π)=l} är den omvända operationen av B. Slutligen definieras CTC-förlusterna för funktionssekvensen enligt följande [17]:
Lctc=− ln p(` |o)
Den villkorade sannolikheten p(π|X) kan beräknas enligt antagandet om villkorligt oberoende.
4. Experimentella resultat och diskussion

Cistanche-tillägg nära mig - Förbättra minnet
I det här avsnittet kommer vi att förklara detaljerna i vårt experiment med den föreslagna konfigurationen som förklaras i det tidigare avsnittet.
4.1. Datauppsättningar
I det här avsnittet förklarar vi de datamängder som vi använde under detta experiment. Vi använde två datamängder, den första är CSL-datauppsättningen [8,40,41] och den andra är RWTH-PHOENIX-datauppsättningen [33,39]. Båda dessa datauppsättningar är kontinuerliga teckenspråksdatauppsättningar, som används för att översätta vissa serier av gester till en hel mening.
4.1.1. CSL Dataset
CSL-datauppsättningen har använts av flera verk [8,40,41]. Det finns totalt 100 meningar och 178 ord i denna datauppsättning, som vanligtvis används i daglig kommunikation. Denna datauppsättning innehåller i genomsnitt 5 ord per mening. Varje mening utfördes av 50 undertecknare 5 gånger. Det totala antalet videor är alltså 25,000, vilket gör detta till en av de största datamängderna. För att träna vår CSL-modell delade vi upp datauppsättningen i data för träning med 20,{11}} videor och för testning med 5 000 videor av samma mening men med olika undertecknare.
4.1.2. RWTH-PHOENIX Dataset
RWTH-PHOENIX datasetet [33,39] är en tysk teckenspråksdatauppsättning, som är en inspelning av offentliga vädersändningar från tv-stationer i Tyskland. Den här videon bearbetas så att den har en storlek på 210 × 260. Det finns 6841 olika meningar signerade av 9 olika undertecknare. Alla undertecknarna bar mörka kläder på en ljus bakgrund. Totalt finns det 1232 ord med cirka 80,{11}} ord. Denna datauppsättning är uppdelad enligt ett förutbestämt format, bestående av 5672 träningsprov, 540 validerings-/utvecklingsprov och 629 testprov.
4.2. Dataförbehandling
Det första vi behövde göra var att förbehandla vår datauppsättning för att passa vår föreslagna modell. Vi utförde storleksändring och beskärning, som illustreras av figur 3; på vänster sida kan vi se att originaldata har en storlek på full HD eller 1920 × 1080 upplösning. Vi behövde beskära och ändra storlek på den till 224 × 224 upplösning eftersom vår rumsliga modul tar emot indata som är av samma storlek som ResNet50-ingången. Efter det matade vi in data i vår rumsliga modell, som skulle producera 7 × 7 tensor från en enda bild.
Den förbehandlade helbildsbilden användes sedan för att generera nyckelpunktsfunktionerna. Vi använde HRNet-modellen för att förutsäga de 133 nyckelpunkterna från dessa RGB-bilder. Men vi använder bara 27 nyckelpunkter på överkroppen i vår föreslagna modell. Inmatningsstorleken för nyckelpunktsfunktionerna är 27 × 3 eftersom vi har 3-axelns (x, y och z) koordinatdata per punkt. Inmatningsmåttet för modellen är N × 224 × 224 × 3 för helskärmsfunktionen och N × 1 × 27 × 3 för nyckelpunktsinmatningen, där N är antalet bildrutor. För att förbättra variationen av datamängden följer vi förstärkningen från [12], inklusive slumpmässig beskärning, horisontell vändning och slumpmässig tidsmässig skalning. Slumpmässig beskärning används också som en del av ett förbearbetningssteg för att beskära originalbilden.

Cistanche-tillägg nära mig - Förbättra minnet
4.3. Utvärderingsmått
För att utvärdera igenkänningsprestandan för vår föreslagna modell använder vi ett mått för ordfelfrekvens (WER), vilket är ett mått som vanligtvis används i CSLR för att uppskatta igenkänningsnoggrannheten för en förutsagd mening, vilket visas av ekvationen nedan [17]:
WER=S plus I plus DT=S plus I plus DS plus C plus D
där S är antalet ersättningar av det ursprungliga ordet, I är antalet infogningar som inte finns i den ursprungliga meningen, D är antalet raderingar som borde ha varit i den ursprungliga meningen, C är antalet korrekta ord som matchar den ursprungliga meningen, och T är det totala antalet ord i meningen eller som kan erhållas från summan av ersättningar, strykningar och korrekta ord. För CSL används varje tecken för att representera ett ord.
4.4. Experimentera med ingångsströmmar
Detta experiment fokuserar huvudsakligen på att jämföra enkelströms- och multiströmsindata på vår modell. Syftet är att hitta den bästa konfigurationen av ingångsströmmen. Vi använder endast RWTH-PHOENIX-datauppsättningen i detta experiment. Vår modell skulle få två separata ingångar, full-frame och keypoint input. Enkelströmingången använder endast RGB-funktionen från helbildsbilden. Det finns två enkelströms-ingångsexperiment. Den första använder endast helskärmsfunktionen från RGB-bilden, och den andra använder nyckelpunktsfunktioner från nyckelpunktsinmatningen. Multiströmsingången som vi föreslår består av RGB- och nyckelpunktsfunktioner. Jämförelseresultatet med en enkelström och multiström visas i tabell 1. Här kan vi se att genom att använda multiströmsfunktionen kan vi få ett bättre resultat än genom att använda en enkelström. Mainstreamen erhålls från en full-frame RGB-funktion och den extra streamen använder nyckelpunktsfunktionerna. Den extra keypoint-strömmen hjälper modellen att lära sig bättre, särskilt för att fånga detaljerna i handformen.
Tabell 1. Jämförelse av WER-prestanda med enkelström och multiströmingång.

4.5. Experimentera med uppmärksamhetsmodulen
Syftet med detta experiment var att välja den bästa konfigurationen av uppmärksamhetsmodulen. I det här experimentet använder vi konfigurationen av det bästa resultatet från det tidigare experimentresultatet och samma datauppsättning. Vi betecknar rumslig uppmärksamhet som modellen med ett självuppmärksamhetslager i slutet av den rumsliga modulen för varje funktion. Tidig tidsuppmärksamhet är självuppmärksamhetsskiktet efter den första temporala poolningen, och sen temporal uppmärksamhet är självuppmärksamhetsskiktet efter den andra temporala poolningen. Här kommer vi att jämföra alla konfigurationer ovan och kombinationen av rumslig och tidsmässig uppmärksamhet. Resultatet visas i tabell 2. Resultatet av rumslig uppmärksamhet är sämre än tidsmässig uppmärksamhet. Den rumsliga nivån innehåller en sekvens av funktioner för varje bildruta. Som nämnts i [20] är självuppmärksamhetslagret lättare att lära sig den kortare vägen mellan långa beroenden. Därför misslyckas rumslig uppmärksamhet att minska WER på grund av den långa sekvensen. Å andra sidan kunde vi få ett förbättrat resultat genom att använda tidsmässig uppmärksamhet genom att lägga det efter poolningen så att det skulle få en kortare sekvenslängd. Den sena uppmärksamhet som har den kortaste sekvenslängden ger det bästa resultatet. Dessutom är kombinationen av uppmärksamhetsmodulen i spatial och temporal sämre än att endast använda enstaka uppmärksamhet. Baserat på dessa resultat tillämpar vi den bästa konfigurationen för experimenten och framåt.
Tabell 2. WER Prestandajämförelse med olika uppmärksamhetskonfigurationer

4.6. Ablationsexperiment på STAMF-nätverket
Dessutom utför vi ett ablationsexperiment med samma datauppsättning och den bästa konfigurationen av ingångsströmmen och uppmärksamhetsmodulen. Tabell 3 på ett experiment med användning av sen temporal uppmärksamhet utan pooling bevisar att sekvenslängd påverkar uppmärksamhetsprestanda. De experiment som använder poollager med kortare sekvenslängder ger bättre resultat. Vi utför också ett ablationsexperiment för att veta prestandan med hjälp av olika modeller för sekvensinlärning. Resultatet i tabell 4 visar att användning av LSTM, som endast har envägsinformation, har lägre prestanda än att använda Bi-LSTM, som har tvåvägsinformation.
Tabell 3. Jämförelse av WER-prestanda med hjälp av olika konfigurationer för sent temporal uppmärksamhet.

Tabell 4. Jämförelse av WER-prestanda med olika sekvensinlärningskonfigurationer.

4.7. Experimentera på STAMF-nätverket
I det här avsnittet förklarar vi hela träningsprocessen för vår föreslagna modell som kallas spatiotemporal attentive multi-feature (STAMF). Detta kommer att täcka hur vi passar in vår indata i den rumsliga modulen, den temporala modulen och sekvensinlärningsmodulen steg för steg. I det här avsnittet använder vi multiströmsinmatning och sen temporal uppmärksamhetskonfiguration.
4.7.1. Implementeringsdetaljer
Vi utför end-to-end-träning och testning med hjälp av inmatningsramar med storlekarna 224 × 224. För optimeraren använder vi en Adam-optimerare med 10−4 som inlärningshastighet och dividerar den med 2 vid epok 10 och 15 för CSL och epok 30, 40 och 60 för RWTH PHOENIX. Vi ställer in batchstorleken till 4 och utför 80 epoker för RWTH-PHOENIX och 20 epoker för CSL. Utbildningen och testningen kördes på NVIDIA Tesla V100 och 128G RAM.
Först extraherade vi funktionen från RGB-strömmar med ResNet50 och använde HRNet för att erhålla nyckelpunkten och sedan extrahera nyckelpunktsfunktionerna med ResNet50. Observera att vi hade att göra med sekventiell data eller en video. Därför behövde vi konfigurera vår ingångsstorlek beroende på längden på videon. Av tekniska skäl behövde indatastorleken för alla data vara identiska med varandra. Därför måste vi känna till den längsta videon i vår datauppsättning, sedan vadderade vi vår inmatningsbildlängd för att matcha det största bildrutetalet
Dessa sekventiellt extraherade funktioner användes av den temporala modulen. Varje sekventiell ström gick igenom två staplade temporal pooling. Varje temporal pooling bestod av ett 1-dimensionellt faltningsnätverk och ett maxpoolningslager, vilket minskade längden på sekvensen med hälften. Utsignalen från den temporala poolningen från båda strömmarna kopplades sedan till uppmärksamhetslagret och för den sista temporala poolningen, efter uppmärksamhetslagret, sammanlänkades den i slutet som den temporala modulutgången.
Den tidsmässiga utmatningen bearbetades av sekvensinlärningsmodulen. Processen använde Bi-LSTM-skiktet kopplat till CTC för att få den slutliga justeringen och komponera glansen till en sista mening.
4.7.2. Kvantitativt resultat
De sista meningarna jämfördes med grundsanningen för att beräkna WER-poängen som ett kvantitativt resultat. För CSL delar vi upp datasetet i 80 procent för träningsdata och 20 procent för testdata. Som visas i tabell 5 kan vår föreslagna multifunktionsmodell (STMF) som använder full-frame och keypoint-funktionerna uppnå ett bättre resultat och minska WER till 0,8 jämfört med modellen som endast använder full-frame-funktionen [23]. Vårt bästa resultat erhölls av den föreslagna multifunktionsmodellen med hjälp av uppmärksamhetsmekanismen (STAMF), som uppnådde 0,7 för WER. Uppmärksamhetslagret förbättrade fortfarande resultatet något även om CSL-datauppsättningen inte hade några defekta ramar. Detta bevisar att uppmärksamhetslagret har en inverkan på modellen. Den föreslagna multifunktionsmodellen i sig är överlägsen de senaste metoderna och uppmärksamhetslagret bidrar till att minska WER-poängen på CSL-datauppsättningen. Nyckelpunkten på CSL ger en betydande inverkan eftersom den kan ge effektiv information jämfört med den andra flerfunktionsmetoden [17] som använder händer, ansikte och kroppsställningar.
För RWTH-PHOENIX-datauppsättningen använde vi den artificiella konfigurationen för att dela upp tränings- och testdata. Datauppsättningen var uppdelad i 5672 exempelvideor för utbildning, 540 exempelvideor för självvalidering och 629 exempelvideor för testning. Som visas i tabell 6 hade vårt föreslagna resultat för multifunktionsmodellen (STMF) med fullbilds- och nyckelpunktsfunktionerna 24 procent WER, och vårt bästa resultat var 20,5 procent, erhållet av den föreslagna modellen med uppmärksamhetsmodulen (STAMF) i träningsresultatet. Testresultaten är näst bäst jämfört med [17] eftersom de använder fler funktioner som input. Uppmärksamhetsmodulen har dock visat sig ge ett betydande bidrag till att minska WER-poängen för RWTHPHOENIX-datauppsättningen. Till skillnad från vårt resultat för CSL-datauppsättningen, uppnådde inte vår föreslagna modell med multi-stream ett optimalt resultat. Detta beror på att RWTH-PHOENIX-datauppsättningen har många defekta ramar; de har en suddig del, speciellt i handområdet. Denna ram ger inkonsekvent nyckelpunktsinformation på grund av saknad eller felaktig nyckelpunktsposition och gör modellen mindre optimal. Detta problem hanteras genom att lägga till uppmärksamhetslagret till vår föreslagna multifunktionsmodell, vilket hjälper till att välja rätt information och resulterar i betydande förbättringar jämfört med den föreslagna multifunktionsmodellen utan uppmärksamhet.
Tabell 5. WER Prestandajämförelse på CSL-datauppsättningen.

Tabell 6. WER-prestandajämförelse på RWTH-PHOENIX-datauppsättningen.

4.7.3. Kvalitativt resultat
Vi gjorde också en kvalitativ utvärdering av vår modell, med hjälp av en visualisering av igenkänningsresultatet. Figur 8 visar detaljerna i vår kvalitativa utvärdering med hjälp av tre exempel på meningar. Den första meningen består av 10 ord och det totala antalet ramar är 220. Den andra meningen består av 12 ord och det totala antalet ramar är 168. Den tredje meningen består av 9 ord och det totala antalet ramar är 135.
Provresultatet visar att vissa glanser inte är korrekt förutspådda av modellerna, och vi betecknar det med den röda markeringen. Det kan dock fortfarande förutsäga majoriteten av korrekta ord. Det största antalet fel finns i den första meningen, som har det längsta ramnumret. I den här meningen har början av meningen fler fel, på grund av att flera gester för de tidiga orden bara skiljer sig något så det är svårt att särskilja gränserna. Den föreslagna modellen med multifunktion och uppmärksamhet (STAMF) kunde dock identifiera fler ord, men de var felmärkta. Dessutom uppnår modellkonfigurationen med uppmärksamhet ett bättre igenkänningsresultat för ytterligare två prover, jämfört med den föreslagna modellen utan uppmärksamhet.

Figur 8. Kvalitativ utvärdering av igenkänningsresultatet med en annan konfiguration av RWTH-PHOENIX-datauppsättningen [33,39]. Fel predikterade gloser är markerade med rött.
5. Slutsatser
I detta dokument presenterar vi en ny spatiotemporal attentive multi-feature (STAMF) för CSLR, som syftar till att lära sig rumsliga-temporala korrelationer och den viktiga informationen från sekvensen av visuella funktioner och nyckelpunktsfunktioner i end-to-end-metoden. I vårt ramverk utvecklades en rumslig modul med en fullbildsfunktion från RGB-data och nyckelpunkter från huvudpunkterna, inklusive händerna som multifunktioner. Dessa kombinationer som användes som indata för flerströmsfunktioner gav överlägsen prestanda jämfört med det senaste tillvägagångssättet som endast använder fullformat eller jämfört med metoden Figur 8. Kvalitativ utvärdering av igenkänningsresultatet med en annan konfiguration av RWTH -PHOENIX dataset [33,39]. Fel predikterade gloser är markerade med rött. 5. Slutsatser I det här dokumentet presenterar vi en ny spatiotemporal attentive multi-feature (STAMF) för CSLR, som syftar till att lära sig rumsliga-temporala korrelationer och den viktiga informationen från sekvensen av visuella egenskaper och nyckelpunktsegenskaper i slut-till- avsluta tillvägagångssätt. I vårt ramverk utvecklades en rumslig modul med en fullbildsfunktion från RGB-data och nyckelpunkter från huvudpunkterna, inklusive händerna som multifunktioner. Dessa kombinationer som användes som multi-stream-funktionsindata gav överlägsen prestanda jämfört med det senaste tillvägagångssättet som endast använder full-frame eller jämfört med metoden som använder en annan kombination av flera funktioner, speciellt för CSL-datauppsättningen. Sedan föreslår vi en temporal modul som består av temporal pooling och temporal uppmärksamhet för att fånga den viktiga informationen i den temporala domänen. Tillägget av sen temporal uppmärksamhet kan erhålla den viktiga egenskapen från sekvensen som har felaktig information och ger betydande förbättringar jämfört med vår föreslagna multifunktionsmodell. Det hjälper också sekvensinlärningen att lära sig bättre och förbättrar prestandan som i experimentet med CSL-datauppsättningen. Omfattande experiment på vanliga datauppsättningar visar överlägsenheten hos vår föreslagna modell jämfört med den senaste modellen med WER-poäng som minskar med mer än 50 procent för CSL-datauppsättningen och minskar med 5 procent för RWTH-PHOENIX-datauppsättningen. I framtiden planerar vi att implementera transfer learning-tekniken med vår nuvarande modell samt tillämpa vårt pågående arbete i en riktig bransch.
Referenser
1. Dreuw, P.; Rybach, D.; Deselaers, T.; Zahedi, M.; Ney, H. Taligenkänningstekniker för ett teckenspråksigenkänningssystem. I Proceedings of the INTERSPEECH 2007, 8:e årliga konferensen för International Speech Communication Association, Antwerpen, Belgien, 27–31 augusti 2007; s. 2513–2516.
2. Ong, SCW; Ranganath, S. Automatisk teckenspråksanalys: A Survey and the Future Beyond Lexical Meaning. IEEE Trans. Mönster Anal. Mach. Intell. 2005, 27, 873–891. [CrossRef] [PubMed]
3. Vogler, C.; Metaxas, D. Ett ramverk för att erkänna de samtidiga aspekterna av amerikanskt teckenspråk. Comput. Vis. Bild Underst. 2001, 81, 358–384. [CrossRef]
4. Bowden, R.; Windridge, D.; Kadir, T.; Zisserman, A.; Brady, M. En språklig funktionsvektor för visuell tolkning av teckenspråk. I Proceedings of the European Conference on Computer Vision (ECCV), Prag, Tjeckien, 11–14 maj 2004; s. 390–401.
5. Kasukurthi, N.; Rokad, B.; Bidani, S.; Dennisan, DA American Sign Language Alphabet Recognition med hjälp av Deep Learning. arXiv 2019, arXiv:1905.05487.
6. Koller, O.; Zargaran, S.; Ney, H.; Bowden, R. Deep Sign: Enabling Robust Statistical Continuous Sign Language Recognition via Hybrid CNN-HMMs. Int. J. Comput. Vis. 2018, 126, 1311–1325. [CrossRef]
7. Pu, J.; Zhou, W.; Li, H. Utvidgat konvolutionellt nätverk med iterativ optimering för kontinuerlig teckenspråksigenkänning. In Proceedings of the Twenty-Seventh International Joint Conference on Artificiell Intelligens, Stockholm, Sverige, 13–19 juli 2018; s. 885–891.
8. Pu, J.; Zhou, W.; Li, H. Iterative Alignment Network for Continuous Sign Language Recognition. I Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition, Long Beach, CA, USA, 15–20 juni 2019; s. 4160–4169.
9. Kumar, N. Rörelsebana baserad spårning av mänskligt ansikte och händer för teckenspråksigenkänning. I Proceedings of the 2017 4th IEEE Uttar Pradesh Section International Conference on Electrical, Computer and Electronics, Mathura, Indien, 26–28 oktober 2017; s. 211–216.
10. Bhuyan, MK; Ghoah, D.; Bora, PK Ett ramverk för handgesterigenkänning med applikationer för teckenspråk. I Proceedings of the 2006 Annual India Conference, INDICON, New Delhi, Indien, 15–17 september 2006; s. 1–6.
11. Das, SP; Talukdar, AK; Sarma, KK Teckenspråksigenkänning med ansiktsuttryck. I Proceedings of the Procedia Computer Science, Kerala, Indien, 10–13 augusti 2015; s. 210–216.
12. Rastgoo, R.; Kiani, K.; Escalera, S.; Sabokrou, M. Teckenspråksproduktion: En recension. I Proceedings of the 2021 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW), Nashville, TN, USA, 19–25 juni 2021; s. 3446–3456.
13. Dong, S.; Wang, P.; Abbas, K. En undersökning om djupinlärning och dess tillämpningar. Comput. Sci. Rev. 2021, 40, 100379. [CrossRef]
14. Athitsos, V.; Neidle, C.; Sclaroff, S.; Nash, J.; Stefan, A.; Yuan, Q.; Thangali, A. American Sign Language Lexicon Video Dataset. I Proceedings of the 2008 IEEE Computer Society Conference on Computer Vision and Pattern Recognition Workshops, CVPR Workshops, Anchorage, Alaska, 23–28 juni 2008; s. 1–8.
15. Bungeroth, J.; Stein, D.; Dreuw, P.; Ney, H.; Morrissey, S.; Way, A.; Zijl, LV ATIS teckenspråkskorpus. I Proceedings of the 6th International Conference on Language Resources and Evaluation, LREC 2008, Marrakech, Marocko, 28–30 maj 2008; s. 2943–2946.
16. Papastratis, I.; Chatzikonstantinou, C.; Konstantinidis, D.; Dimitropoulos, K.; Daras, P. Artificiell intelligensteknik för teckenspråk. Sensors 2021, 21, 5843. [CrossRef] [PubMed]
17. Zhou, H.; Zhou, W.; Zhou, Y.; Li, H. Spatial-temporal Multi-cue Network för kontinuerlig teckenspråksigenkänning. In Proceedings of the AAAI 2020—The Thirty-Fourth AAAI Conference on Artifificial Intelligence, New York, NY, USA, 7–12 februari 2020; s. 13009–13016.
18. Gündüz, C.; Polat, H. Turkiskt teckenspråksigenkänning baserat på multiströmsdatafusion. turkiska J. Electr. Eng. Comput. Sci. 2021, 29, 1171–1186. [CrossRef]
19. Bohacek, M.; Hruz, M. Sign Pose-baserad transformator för teckenspråksigenkänning på ordnivå. I Proceedings of the 2022 IEEE/CVF Winter Conference on Applications of Computer Vision Workshops, WACVW, Waikoloa, HI, USA, 4–8 januari 2022; s. 182–191.
20. Vaswani, A. Uppmärksamhet är allt du behöver. I Proceedings of the Conference on Neural Information Processing Systems, Long Beach, CA, USA, 4–9 december 2017; s. 1–11.
21. Zhou, M.; Ng, M.; Cai, Z.; Cheung, KC Självuppmärksamhetsbaserade helt nya nätverk för kontinuerlig teckenspråksigenkänning. Främre. Artif. Intell. Appl. 2020, 325, 2832–2839.
22. Camgöz, NC; Koller, O.; Hadfifield, S.; Bowden, R. Sign Language Transformers: Gemensam end-to-end teckenspråksigenkänning och översättning. I Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition, Seattle, WA, USA, 14–19 juni 2020; s. 10020–10030.
23. Min, Y.; Hao, A.; Chai, X.; Chen, X. Visual Alignment Constraint for Continuous Sign Language Recognition. I Proceedings of the IEEE International Conference on Computer Vision (ICCV), Montreal, BC, Kanada, 10–17 oktober 2021; s. 11542–11551.
24. Guo, D.; Zhou, W.; Wang, M.; Li, H. Teckenspråksigenkänning baserad på adaptiva HMM:er med dataökning. I Proceedings of the IEEE International Conference on Image Processing (ICIP), Phoenix, AZ, USA, 25–28 september 2016; s. 2876–2880.
25. Huang, J.; Zhou, W.; Li, H.; Li, W. Teckenspråksigenkänning med 3D-konvolutionella neurala nätverk. I Proceedings of the IEEE International Conference on Multimedia and Expo (ICME), Turin, Italien, 29 juni–3 juli 2015; s. 1–6.
26. Guo, D.; Zhou, W.; Li, H.; Wang, M. Online tidigt-sen fusion baserat på adaptiv HMM för teckenspråksigenkänning. ACM Trans. Multimed. Comput. Commun. Appl. 2017, 14, 1–18. [CrossRef]
27. Al-hammadi, M.; Muhammad, G.; Medlem, S. Handgesterigenkänning för teckenspråk med 3DCNN. IEEE Access 2020, 8, 79491–79509. [CrossRef]
28. Reza, H.; Joze, V. MS-ASL: En storskalig datamängd och benchmark för att förstå amerikanskt teckenspråk. arXiv 2019, arXiv:1812.01053.
29. Li, D.; Opazo, CR; Yu, X.; Li, H. Deep Sign Language Recognition på ordnivå från video: En ny storskalig datauppsättning och jämförelse av metoder. I förfarandet för 2020 IEEE Winter Conference on Applications of Computer Vision, WACV, Snowmass Village, CO, USA, 1–5 mars 2020; s. 1448–1458.
30. Pu, J.; Zhou, W.; Li, H. Teckenspråksigenkänning med multimodala funktioner. I Proceedings of the Pacific Rim Conference on Multimedia, Xi'an, Kina, 15–16 september 2016; s. 252–261.
31. Jiang, S.; Sun, B.; Wang, L.; Bai, Y.; Li, K.; Fu, Y. Skeleton Aware Multi-modal teckenspråksigenkänning. I Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition Workshops, Nashville, TN, USA, 19–25 juni 2021; s. 3408–3418.
32. Sidig, AAI; Luqman, H.; Mahmoud, S.; Mohandes, M. KArSL: Arabic Sign Language Database. ACM Trans. Asiatisk lågresurs. Lang. Inf. Bearbetning 2021, 20, 1–19. [CrossRef]
33. Koller, O.; Forster, J.; Ney, H. Continuous sign language recognition: Towards large vokabulär statistiska igenkänningssystem som hanterar multipla signers. Comput. Vis. Bild Underst. 2015, 141, 108–125. [CrossRef]
34. Koller, O.; Camgoz, NC; Ney, H. Svagt övervakat lärande med multiströms CNN-LSTM-HMMs för att upptäcka sekventiell parallellism i teckenspråksvideor. IEEE Trans. Mönster Anal. Mach. Intell. 2020, 42, 2306–2320. [CrossRef] [PubMed]
35. Camgoz, NC; Hadfifield, S.; Koller, O.; Bowden, R. SubUNets: End-to-End Hand Shape and Continuous Sign Language Recognition. I Proceedings of the 2017 IEEE International Conference on Computer Vision (ICCV), Venedig, Italien, 22–29 oktober 2017; s. 3075–3084.
36. Dong, C.; Loy, CC; Han, K.; Tang, X. Bildsuperupplösning med djupa konvolutionella nätverk. IEEE Trans. Mönster Anal. Mach. Intell. 2014, 38, 295–307. [CrossRef] [PubMed]
37. Bressem, KK; Adams, LC; Erxleben, C.; Hamm, B.; Niehues, SM; Vahldiek, JL Jämförelse av olika djupinlärningsarkitekturer för klassificering av lungröntgenbilder. Sci. Rep. 2020, 10, 13590. [CrossRef]
38. Sun, K.; Xiao, B.; Liu, D.; Wang, J. Deep High-Representation Learning for Human Pose Estimation. I Proceedings of the IEEE Computer Society Conference on Computer Vision and Pattern Recognition, Long Beach, CA, USA, 15–20 juni 2019; s. 5686–5696.
39. Koller, O.; Zargaran, S.; Ney, H. Re-Sign: Re-Aligned End-to-End sekvensmodellering med djupa återkommande CNN-HMMs. I samband med 2017 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Honululu, HI, USA, 21–26 juli 2017; s. 3416–3424.
40. Zhou, H.; Zhou, W.; Li, H. Dynamisk pseudoetikettavkodning för kontinuerlig teckenspråksigenkänning. I Proceedings of the 2019 IEEE International Conference on Multimedia and Expo (ICME), Shanghai, Kina, 18–21 juli 2019; s. 1282–1287.
41. Xiao, Q.; Chang, X.; Zhang, X.; Liu, X. Videobaserad teckenspråksigenkänning utan temporär segmentering. I Proceedings of the Thirty-Second AAAI Conference on Artificificiell Intelligens, New Orleans, LA, USA, 2–7 februari 2018; s. 2257–2264.
42. Gravar, A.; Fernandez, S.; Gomez, F.; Schmidhuber, J. Connectionist Temporal Classification: Märkning av osegmenterad sekvensdata med återkommande neurala nätverk. In Proceedings of the ICML '06: Proceedings of the 23th international conference on Machine learning, Pittsburgh, PA, USA, 25–29 juni 2006; s. 369–376.
43. Gravar, A.; Liwicki, M.; Fernandez, S.; Bertolami, R.; Bunke, H.; Schmidhuber, J. A Novel Connectionist System for Unconstrained Handwriting Recognition. IEEE Trans. Mönster Anal. Mach. Intell. 2009, 31, 855–868. [CrossRef]
44. Guo, D.; Zhou, W.; Li, H.; Wang, M. Hierarkisk LSTM för teckenspråksöversättning. In Proceedings of the AAAI Conference on Artifificial Intelligence, New Orleans, LA, USA, 2–7 februari 2018; s. 6845–6852.
45. Rahman, MM; Watanobe, Y.; Nakamura, K. En dubbelriktad LSTM-språkmodell för kodutvärdering och reparation. Symmetry 2021, 13, 247. [CrossRef]
46. Hu, W.; Cai, M.; Chen, K.; Ding, H.; Sun, L.; Liang, S.; Mo, X; Huo, Q. Sekvensdiskriminerande träning för offlinehandskriftsigenkänning av en interpolerad CTC och gitterfri MMI-objektivfunktion. I Proceedings of the International Conference on Document Analysis and Recognition, ICDAR, Kyoto, Japan, 9–15 november 2017; Volym 1, s. 61–66.
47. Yoshimura, T.; Hayashi, T.; Takeda, K.; Watanabe, S. End-to-end automatisk taligenkänning integrerad med CTC-baserad röstaktivitetsdetektering. I Proceedings of the ICASSP, IEEE International Conference on Acoustics, Speech and Signal Processing, Barcelona, Spanien, 4–8 maj 2020; s. 6999–7003.
48. Guo, D.; Wang, S.; Tian, Q.; Wang, M. Dense Temporal Convolution Network för teckenspråksöversättning. I Proceedings of the Twenty-Eightth International Joint Conference on Artifificial Intelligence (IJCAI-19), Macao, Kina, 10–16 augusti 2017; s. 744–750.
49. Wang, S.; Guo, D.; Zhou, W.; Zha, Z.; Wang, M. Connectionist Temporal Fusion för teckenspråksöversättning. I Proceedings of the 26th ACM International Conference on Multimedia, Seoul, Korea, 22–26 oktober 2018; s. 1483–1491.
50. Yang, Z.; Shi, Z. SF-Net: Structured Feature Network för kontinuerlig teckenspråksigenkänning. arXiv 2019, arXiv:1908.01341.
51. Cheng, KL; Yang, Z.; Chen, Q.; Tai, Y. Fullt konvolutionerande nätverk för kontinuerlig teckenspråksigenkänning. I Proceedings of the European Conference on Computer Vision, Glasgow, Storbritannien, 23–28 augusti 2020; s. 697–714.
52. Koller, O.; Ney, H.; Bowden, R. Deep Hand: How to Train a CNN on 1 Million Hand Images When Your Data is Continuous and Weakly Labeled. I Proceedings of the 2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), Las Vegas, NV, USA, 27–30 juni 2016; s. 3793–3802.
53. Slimane, FB Context Matters: Självuppmärksamhet för teckenspråksigenkänning. arXiv 2021, arXiv:2101.04632.
54. Niu, Z.; Mak, B. Stokastisk finkornig märkning av teckenglans i flera tillstånd för kontinuerlig teckenspråksigenkänning. I Proceedings of the European Conference on Computer Vision, Glasgow, Storbritannien, 23–28 augusti 2020; s. 1–16.
55. Cui, R.; Liu, H.; Zhang, C. A Deep Neural Framework for Continuous Sign Language Recognition by Iterative Training. IEEE Trans. Multimed. 2019, 21, 1880–1891. [CrossRef]
56. Pu, J.; Zhou, W.; Hu, H.; Li, H. Boosting Continuous Sign Language Recognition via Cross Modality Augmentation. I Proceedings of the 28th ACM International Conference on Multimedia, Seattle, WA, USA, 12–16 oktober 2020; s. 1497–1505.






