AttentionMNIST: En uppsättning för uppmärksamhetsspårning med musklick för handskrivna siffror och alfabetigenkänning

Feb 22, 2024

Flera uppmärksamhetsbaserade modeller som känner igen objekt via en sekvens av glimtar har rapporterat resultat på handskriven sifferigenkänning. Däremot finns inga uppmärksamhetsspårningsdata för handskrivna siffror eller alfabetigenkänning. Tillgängligheten av sådana data skulle göra det möjligt att utvärdera uppmärksamhetsbaserade modeller i jämförelse med mänsklig prestation. Vi samlar in uppmärksamhetsspårningsdata från musklick från 382 deltagare som försöker känna igen handskrivna siffror och alfabet (versaler och gemener) från bilder via sekventiell sampling. Bilder från benchmark-datauppsättningar presenteras som stimuli. Den insamlade datamängden, kallad AttentionMNIST, består av en sekvens av exempel (musklick) platser, pr.föreskrivna klassetiketter vid varje provtagning och varaktigheten av varje provtagning. I genomsnitt observerar våra deltagare endast 12,8 % av en bild för igenkänning. Vi föreslår en baslinjemodell för att förutsäga platsen och de klasser som en deltagare kommer att välja vid nästa provtagning. När de utsätts för samma stimuli och experimentella förhållanden som våra deltagare, faller en mycket citerad uppmärksamhetsbaserad förstärkningsmodell till brist på mänsklig effektivitet.

Chinese herb cistanche

kinesisk cistancheört- Förhindra produkter från Alzheimers sjukdom

Maskininlärningsmodeller (ML) som känner igen objekt via en sekvens av glimtar har fått intresse de senaste åren på grund av deras skalbarhet och effektivitet. Många av dessa modeller, till exempel 1–7, har rapporterat experimentella resultat på referensdatasetet MNIST för handskrivna siffror. Tyvärr finns inga uppmärksamhetsspårningsdata för MNIST. Detta förhindrar utvärdering av uppmärksamhetsbaserade modeller i jämförelse med mänsklig prestation. Vi föll i den luckan genom att samla in en datauppsättning från vuxna deltagare som försökte känna igen handskrivna siffror och alfabet från bilder via sekventiell provtagning. Till skillnad från ögonrörelseuppmärksamhetsspårning (emAT), klickar en deltagare på platsen i bilden som han vill se (en form av musklicksuppmärksamhetsspårning (mcAT)). Omedelbart efter det väljer han klass(er) som han förutsäger objektet kan tillhöra baserat på hans observationer hittills. Sålunda, vid varje provtagningsavsnitt består våra data av den valda bildplatsen, klassetikett(er) förutspådd och tid som tagits sedan det senaste avsnittet av deltagaren. Efter varje bild får deltagaren en belöning baserat på hans prestation (noggrannhet och effektivitet).

Anti Alzheimer's disease

Fördelar med cistanche tubulosa-Anti Alzheimers sjukdom

Fördelar med mcAT framför emAT för handskrivna siffror/alfabetigenkänning.

(1) kött innehåller betydande intra- och interpersonell variation i fixeringsläge, särskilt för statiska stimuli (bilder)8,9. Så en stor mängd ögonfixeringsdata behövs för att nå statistiskt signifikanta slutsatser. mcAT är inte mottagligt för vissa av de källor till tekniskt brus som är vanliga för eyetracking-data10. (2) Ögonrörelser kan vara resultatet av både frivilliga och ofrivilliga mekanismer11. För att underlätta uppgiftsberoende beslutsfattande presenterar vi deltagarna med adekvata tid, sammanhang och förstärkningssignaler, som också kan presenteras för en ML-modell. (3) Precisionen och noggrannheten hos emAT-data är beroende av eye-trackern medan samma för mcAT är oberoende av någon enhet. (4) Det är en utmaning att synkronisera sina ögonrörelser med sitt klassval. För att övervinna detta, i vårt fall, väljs provtagningsplatsen och klass(er) i samma avsnitt. (5) Slutligen tillåter vår metod datainsamling med Amazon Mechanical Turk (MTurk), som i12,13, vilket är kostnads- och tidseffektivt och lätt reproducerbart.

Bidrag.

Vi samlar in en mcAT-datauppsättning, kallad AttentionMNIST, med hjälp av MTurk från 382 deltagare, belönad för att korrekt och effektivt känna igen handskrivna siffror och alfabet (versaler och gemener) från bilder via sekventiell sampling. Bilder från benchmark-datauppsättningar (MNIST, EMNIST) presenteras som stimuli. I genomsnitt registreras 169,1 svar per siffer-/alfabetklass. Med hjälp av denna datauppsättning visar vi följande: • I genomsnitt kräver deltagarna 4,2, 4,7 och 4,9 prover för att känna igen ett alfabet med siffror, versaler och gemener, vilket motsvarar endast 11,3 %, 13,4 % respektive 13,7 % av bildytan. . Klassificeringsnoggrannheten ökar med flera prover. • En modell, presenterad som baslinjen, kan förutsäga klass(er) och plats som en deltagare kommer att välja vid nästa provtagningsavsnitt med 74,4 % respektive 67,7 % noggrannhet, båda i genomsnitt över alla provtagningar och datauppsättningar. Klasspredikteringsnoggrannheten ökar och platsförutsägelsenoggrannheten minskar med en ökning av sampel. • När den utsätts för samma stimuli och förhållanden som våra deltagare, kräver en mycket citerad förstärkningsbaserad återkommande uppmärksamhetsmodell (RAM)3 3,7, 8,5 och 7,6 prover för att känna igen ett siffror, versaler och gemener, vilket motsvarar 8,9 % , 21,0%, 18,7% av bildytan. Andra uppmärksamhetsbaserade förstärkningsmodeller (t.ex. 1,2,4,5,7,14) kan på liknande sätt utvärderas i jämförelse med mänsklig prestation.

Cistanche supplement near me-Improve memory2

Cistanche-tillägg nära mig - Förbättra minnet

Klicka här för att se produkter för Cistanche Improving Memory and Prevent Alzheimers Disease

【Be om mer】 E-post:cindy.xue@wecistanche.com / Whats App: 0086 18599088692 / Wechat: 18599088692

Relaterat arbete

Den tidsmässiga sekvensen av musklick i mcAT är analog med ögonrörelsens scanpath10. mcAT kan effektivt ersätta emAT eftersom de är signifikant korrelerade10,12,13,15–17. Olika typer av stimuli har använts i mcAT-studier, såsom bilder av livliga och livlösa föremål10, bilder av naturliga scener12,13, statiska webbsidor13, söksideslayouter16 och två listor med alfanumeriska strängar för visuell jämförelse17. Men mcAT har inte använts för handskrivna klassificeringsuppgifter med siffror/alfabet eller utvärdering av uppmärksamhetsbaserade klassificeringsmodeller. mcAT-studier har använt funktioner som tid till kontakt, relativ fixeringsfrekvens i intresseområden (AOI), relativ andel försökspersoner som klickade minst en gång i en AOI10, antal fixeringar per försök, återfixering inom försök, uppehållstider och scanpaths17 , fixeringskartor12,13, AOI och informationsflödesmönster16. Sekvensen av tidsstämplade klickplatser och förutspådda klassetiketter utgör rådata som är nödvändiga för att utvärdera effektiviteten och noggrannheten hos uppmärksamhetsbaserade modeller eller människor i klassificeringsuppgifter. Olika egenskaper kan härledas från dessa data. Vår mcAT-datauppsättning, med flera fördelar jämfört med eyetracking-data, fyller en avgörande lucka i uppmärksamhetsbaserad modellforskning inom AI, ML och andra områden. Vår datauppsättning kommer att tillåta uppmärksamhetsbaserade modeller att utvärderas i jämförelse med mänsklig prestation. Detta kommer bland annat att underlätta utvecklingen av effektiva och realtidsoptiska teckenigenkänningssystem som har bred användning i praktiken (se till exempel 18–20). Principer som styr visuell fixering kan antas och testas med hjälp av vår datauppsättning. De framgångsrika principerna kan överföras till att utveckla system för verkliga visuella igenkänningsuppgifter där effektivitet är en nyckelfråga, till exempel vid autonom körning.

Data

Vår data består av en sekvens av T-episoder för varje deltagare. Data från varje avsnitt består av (1) platsen i bilden som deltagaren klickade på (ett klick på bilden per avsnitt), (2) klassen/klasserna som valts av deltagaren och (3) tiden som deltagaren att registrera det aktuella provet (dvs. tiden som förflutit mellan senaste och nuvarande klick på bilden). Det här avsnittet kommer att förklara vår datainsamlingsprocess inklusive urval av stimuli, deltagare, visuella uppgifter, prestationspoäng och datafiltrering.

Stimuli urval. Stimuli väljs från bilder i två referensdatauppsättningar: (1)

MNIST21-datauppsättningen består av 70,000 märkta bilder (28×28 pixlar) med 10 handskrivna siffror {0, 1, ..., 9}. (2)

EMNIST22-datauppsättningen består av 145 600 bilder (28×28 pixlar) av handskrivna engelska alfabet med versaler och gemener, vilket bildar en balanserad klass. Alla bilder är märkta med en av 26 klasser {a, b, ..., z}. En etikett med versaler eller gemener är dock inte kopplade till någon bild. Från varje kategori väljer vi 15 välformade siffror från MNIST och 15 välformade alfabet vardera från EMNIST versaler och EMNIST gemener datauppsättningar. En välformad siffra eller alfabet liknar normen för sin klass. Därför presenterar vi stimuli från en uppsättning av 15(10 + 26 + 26)=930 unika bilder, med 15 bilder som tillhör var och en av de 62 klasserna. De välformade 930 bilderna väljs ut enligt följande:

Steg 1: Normalisera varje bild med min-max för att skala intensiteten mellan 0 och 1.

Steg 2: Märk välformade EMNIST-bilder med versaler eller gemener. För varje alfabetsklass väljs ett välformat alfabet från både versaler och gemener manuellt ut och märks. Cosinuslikheten för alla bilder som tillhör den klassen med de två märkta bilderna beräknas. Bilderna som ligger över tröskelvärdet för cosinuslikhet (empiriskt valda som 0.8) tilldelas etiketten versaler eller gemener.

Steg 3: Beräkna medelvärdet av bilderna som tillhör varje klass. Den genomsnittliga bilden av en klass utgör dess norm. En bild är kvalificerad att vara en stimulans om dess cosinuslikhet med medelbilden för dess klass är större än en empiriskt bestämd tröskel (0.7 för MNIST, 0.75 för EMNIST).

Steg 4: Bland de kvalificerade bilderna väljs 15 bilder från varje klass ut manuellt baserat på hur välformade de är. Varje bild, ursprungligen 28×28 pixlar, reduceras till 27×25 genom att ta bort pixlarna nära gränserna eftersom de inte har någon intensitetsvariation. Medelvärdet av dessa 15 bilder beräknas för var och en av de 62 klasserna. Vi betecknar dessa medelbilder som I1, I2, ..., In för n klasser i varje dataset.

Deltagare.

Totalt deltog 382 distinkta vuxna individer i vår studie. Inga urvalskriterier användes. En deltagare kan svara på flera bilder. För var och en av de 62 klasserna registrerades i genomsnitt 169,1 svar.

man-5989553_960_720

Fördelarna med cistanche tubulosa-Anti Alzheimers sjukdom

Visuell uppgift.

MTurk-gränssnittet för vår visuella uppgift visas i Fig. 1. En duk i storleken 270×250 visar hela tiden en bakgrundsbild med låg intensitet. Bakgrunds- och stimulusbilderna uppsamplas tio gånger till 270×250. Dukens mitt är i linje med mitten av bilderna. Bakgrund Inledningsvis är bakgrunden medelvärdet av alla bilder i datamängden som stimulansen hämtas från. Efter det första avsnittet är bakgrunden medelvärdet av alla bilder från uppsättningen klasser som valts av deltagaren i det sista avsnittet. I den verkliga världen erhålls sammanhanget för platsen, storleken och orienteringen av en siffra eller alfabet från skriften i dess grannskap, som saknas här. När våra experiment utfördes med en tom bakgrund, tog deltagarna ofta prov på platser i bilden som inte innehöll någon del av objektet. Detta beteende innehölls genom att presentera medelbilden av den/de valda klassen/klasserna i en lågintensiv bakgrund och minska storleken på alla MNIST- och EMNIST-bilder från 28×28 pixlar till 27×25. Varje gång deltagaren väljer en plats på duken genom att klicka på den, avslöjas en 50×50 pixel lapp centrerad på den platsen från stimulusbilden. En patch som en gång avslöjats fortsätter att visas tills det sista avsnittet. En deltagares uppgift består av tre steg vid varje avsnitt t (t=1, ..., T):

Steg 1: Klicka var som helst på 270×250-duken för att avslöja patchen han vill ta prov. Endast det första klicket accepteras.

Steg 2: Känn igen siffran/alfabetet från alla prover som har observerats hittills. Deltagaren kan välja flera klasser och måste välja minst en klass från listan över klasser som visas under arbetsytan.

Steg 3: Klicka på "Nästa" längst ned på skärmen för att fortsätta. För att kunna sluta sig till klassen exakt och snabbt måste deltagaren välja platser med omtanke utifrån sina observationer fram till det aktuella avsnittet. Det finns ingen tidsgräns för ett avsnitt. Vi begränsar dock den totala tiden för T-avsnitt av en bild till sex minuter. Vi väljer T=12 eftersom mycket citerade verk om uppmärksamhetsbaserad handskriftsigenkänning eller generering har använt färre än 12 glimtar (t.ex. RAM3 kunde känna igen MNIST-siffror inom 7 glimtar, DRAW23 kunde generera MNIST-siffror inom 11 glimtar) och människor kan känna igen handskrivna siffror och alfabet i mycket färre än 12 glimtar.

Prestationspoäng. En poäng tilldelas deltagaren baserat på hans noggrannhet och effektivitet när det gäller antalet observerade prover. Låt det vara uppsättningen klasser han valde vid vilket avsnitt som helst. Tio, hans poäng vid t är:

Figure 1. Our MTurk interface as seen by a participant. Te second sampling for an EMNIST uppercase alphabet is shown.

Figur 1. Vårt MTurk-gränssnitt sett av en deltagare. Den andra samplingen för ett EMNIST-alfabet med versaler visas.

image


där |.| anger kardinaliteten av en mängd. Den totala poängen i T-avsnitt är h {{0}} T t=1 Pt. Därför är det högsta man kan få poäng i T-avsnitt T om han alltid bara väljer rätt klass. Minsta poäng i T-avsnitt är noll om han alltid väljer en uppsättning klasser som inte innehåller rätt klass. Alltså, 0 Mindre än eller lika med h Mindre än eller lika med T. Förr en deltagare väljer rätt klass, desto högre blir hans poäng. Således tar denna poängmekanism hänsyn till igenkänningsnoggrannhet och samplingseffektivitet. Att försöka maximera poängen genom att bara välja en klass från det allra första avsnittet kommer att vara riskabelt eftersom ett poäng på noll kommer att delas ut om det inte är rätt klass, medan ett poäng högre än noll kommer att tilldelas om deltagaren väljer flera klasser ( även alla klasser) som innehåller rätt klass. Detta kommer att motivera deltagaren att svara baserat på de troliga klasserna i hans sinne vid varje avsnitt. Poängen som tilldelas vid varje avsnitt avslöjas endast efter slutförandet av T-avsnitt för att avstå från att ge någon ledtråd till deltagaren. I MTurk är ersättningen som en deltagare får för en bild proportionell mot hans totala poäng, h.

Datafiltrering.

Om en deltagares poäng i det sista (dvs. T:te) avsnittet för en stimulusbild är noll, kasseras hans data som registrerats för den bilden. Uppgifterna kasseras också om en deltagare lämnar uppgiften ofullständig. Med dessa urvalskriterier fick vi svar på 1736 stimuli från MNIST, 4431 stimuli från EMNIST versaler och 4315 stimuli från EMNIST gemener; det vill säga 169,1 svar per klass i snitt.

Modeller och metoder för att utnyttja data

I det här avsnittet illustrerar vi användbarheten av insamlade data genom att (4.1) tillhandahålla en baslinjemodell för att förutsäga en deltagares beteende och (4.2) visa hur en befintlig uppmärksamhetsbaserad förstärkningsmodell kan jämföras med mänskliga siffror/alfabetigenkänning prestanda. Baslinjen för beteendeförutsägelse. Beteende vid varje avsnitt t består av platsval och klassval. Eftersom ett urval innehåller olika mängder information för olika observatörer, eller till och med för samma observatör vid olika tidpunkter9, är beteendeförutsägelse för varje deltagare ett svårt problem. Låt n vara antalet klasser i en datauppsättning, ηt vara singeluppsättningen som innehåller den sanna klassen för stimulusbilden vid t, ct vara uppsättningen klasser och lt vara den plats som valts av en deltagare vid t, för att vara hans observation vid t, och 1:t betecknar sekvensen 1, 2, ..., t. Fram till något t är observationerna av en deltagare o1:t och platserna han valt är l1:t. Vi formulerar problemet med en deltagares beteendeförutsägelse enligt följande: Klassförutsägelse Beräkna sannolikheten för i∈ct (i=1, 2, ..., n) givet hans o1:t och l1:t, dvs P( i ∈ ct|o1:t, l1:t). Platsförutsägelse Uppskatta sannolikheten för lt+1 givet hans o1:t, l1:t och ct, dvs. P(lt+1|o1:t, l1:t,ct). Klassförutsägelse. För att förutsäga vilken klass en deltagare kommer att välja vid avsnitt t, beräknar vi sannolikheten för att bildstimuluset vid t tillhör klass I givet deltagarens valda platser l1:t och motsvarande observationer o1:t, enligt följande:

image

där Ii är medelvärdet av stimulibilderna (27×25) som tillhör klass i, I′ är en 27×25 bild som innehåller o1:t vid l1:t, · betecknar skalär produkt och .betecknar euklidisk norm. Alla pixelintensiteter är icke-negativa. Vid varje avsnitt t utgör de k högsta sannolika klasserna från trosfördelningen P(i|o1:t, l1:t) uppsättningen klasser, ˆct, som förutsägs av vår modell, där k=|ct|. Klassificeringsnoggrannheten mäts med Jaccard-index (JI). JI mäter likheten mellan två uppsättningar, X och Y, som: J(X, Y) {{10}} |X ∩ Y|/|X ∪ Y|. JI är avgränsad mellan 0 och 1; om X=Y, J(X, Y)=1. Vid varje avsnitt t är klassificeringsnoggrannheten för en deltagare J(ηt,ct) medan den för vår modell är J(ηt, ˆct). På grund av sin nämnare straffar JI mer när antalet element i den förutsagda mängden (ct eller ˆct) som inte är i ηt ökar, vilket är en önskvärd egenskap för vårt fall. Likheten mellan en deltagares och vår modells klassificering mäts med J(ct, ˆct). Vår modell utvärderas också i termer av klassval och avslagsnoggrannhet med avseende på varje deltagare. Låt st=ct − ct−1 vara uppsättningen av nya klasser valda och rt=ct−1 − ct vara uppsättningen klasser som avvisats av en deltagare vid t. På liknande sätt är ˆst=ˆct − ct−1 uppsättningen av nya klasser som valts, och ˆrt=ct−1 − ˆct är uppsättningen klasser som avvisats av vår modell vid t. Sedan kan modellens klassval och avslag jämföras med en deltagares med J(st, ˆst) när |st| > 0 och J(rt, ˆrt) när |rt| > 0, respektive. Platsförutsägelse. Hypotes Idealt sett bör trosfördelningen över alla klasser vara unimodal (dvs endast en topp) och en tunn Gaussisk (dvs liten standardavvikelse) i form, vilket indikerar att en deltagare är säker på klassen (tillståndet) för stimulansen (miljön). Men som framgår av våra data (ref. Fig. 2), är en deltagare ofta förvirrad mellan flera klasser, särskilt under de första avsnitten. I dessa fall har hans trosfördelning flera toppar eller är en fet gaussisk. Vi antar att en deltagares mål är att konvergera till en unimodal och tunn Gaussian, för att uppnå vilket han selektivt samplar platser som minskar sannolikheten för alla klasser utom en. Denna hypotes leder till att osäkerheten över klasserna (miljötillstånd) minimeras, vilket är en välkänd princip som styr handling24, inklusive ögonrörelser25.

Figure 2. Duration and class distribution over all participants and stimuli belonging to categories '0', 'a', and 'A'.


Figur 2. Varaktighet och klassfördelning över alla deltagare och stimuli som tillhör kategorierna '0', 'a' och 'A'.

Te observations at certain locations in a stimulus image can discriminate between certain classes. Te observation at a location l might indicate that the numeral/alphabet belongs to class I and not to class j. Such locations are more salient than others in achieving a participant's goal. To sample such locations, a saliency map, Dij, is computed such that if l is salient, the observation at l is evidence to increase the probability of class I and decrease that of j. Mathematically, Dij = N (., σ ) ∗ g(.), where ∗ is the convolution operator, g(.) is a saliency scoring function, and N (., σ ) is a 5×5 Gaussian kernel with standard deviation σ = 6 to smooth the saliency scores. We denote the set of all saliency maps as D = {Dij: i, j ∈ {1, 2, ..., n}, i �= j}. A location l in a stimulus image is salient for class i with respect to class j if Dij(l)>θ, där tröskeln θ=0.5 × max(D) är en empiriskt bestämd skalär storhet.

Vi betraktar två asymmetriska mått, Kullback-Leibler (KL) divergens och skillnad, som kandidater för funktionen g. KL-divergens Givet två normaliserade medelvärden, Ii och Ij, mäter KL-divergensen KL(Ii, Ij) informationsförlusten när Ij används för att approximera Ii. Detta beräknas för varje pixel k as26: KL(Ii,k, Ij,k)=Ii,k log δ + Ii,k Ij,k+δ, där Ij,k är intensiteten för den k:te pixeln av Ij, och δ är en regulariseringskonstant. När Ii,k=Ij,k, KL(Ii,k,Ij,k) → 0. Skillnad Givet två normaliserade medelbilder, Ii och Ij, är skillnaden för varje pixel k Diff (Ii,k, Ij,k)=Ii,k − Ij,k. När Ii,k=Ij,k, Diff (Ii,k, Ij,k)=0. En deltagare är osäker på uppsättningen klasser, ct, han valde vid det aktuella avsnittet. För lägesförutsägelse tar vi därför endast hänsyn till de framträdande kartorna i D som involverar klasserna i ct. En plats förutsägs om den är framträdande baserat på dessa framträdande kartor och aldrig valdes av deltagaren. Tus, givet o1:t, l1:t och ct, förutsägs platsen lt+1 enligt följande:

image

där Ŵ är uppsättningen av 3-tupler som innehåller den förutsagda platsen ˆl, klassen den är framträdande för (i) och med avseende på vilken klass (j). Platsen förutsägs korrekt om det finns en �ˆl, i, j� ∈ Ŵ så att �ˆl − lt+1� < ǫ, I ∈ ct+1 och j /∈ ct{{3} }, där ǫ är det maximala euklidiska avståndet mellan mittpixeln och någon pixel i en observationsfläck. Pseudokoden för lägesförutsägelse visas i Algoritm 1. En detaljerad förklaring av pseudokoden finns i avsnitt S1 i tilläggsmaterialet. (Te sannolikhetsfördelning, P(lt+1|o1:t, l1:t,ct), kan beräknas genom att anta att saliency-poängen för platser som inte är i Ŵ är noll, och sedan normalisera saliency-poängen för alla platser för att summera till enhet. Denna sannolikhet har dock inte använts, eftersom ekv. (3) är tillräcklig för detta dokuments syften.)

image

Utvärdering av uppmärksamhetsbaserade modeller.

Som en representant för uppmärksamhetsbaserade modeller betraktar vi den mycket citerade modellen för återkommande uppmärksamhet (RAM)3 som rapporterar experimentella resultat på MNIST-datauppsättningen. Denna förstärkningsmodell samplar sekventiellt en bild och bestämmer vart nästa prov ska tas vid varje samplingsögonblick, vilket gör det lämpligt för utvärdering med hjälp av insamlade data.

Bagge

klassificerar bilder med en sekvens av glimtar. Nästa plats väljs stokastiskt från en distribution parametriserad av ett lokaliseringsnätverk. Modellen tränas från början genom att maximera följande mål3:

image


där M är antalet episoder, T är antalet observationer, xi 1:t är interaktionssekvenserna som erhålls genom att köra den aktuella agenten tills I episoder, ui t är den aktuella åtgärden, θ är uppsättningen av träningsbara parametrar, Ri t är den kumulativa belöningen, bt är en baslinje och π(ui t|xi 1:t; θ ) är policyn. RAM:s beteende kan jämföras med deltagarnas genom att jämföra fixeringskartorna erhållna från sekvensen av platser som förutsägs av RAM och de som valts av deltagarna. En fixationskarta beräknas genom att tilldela varje plats ett värde lika med frekvensen av dess val, och sedan normalisera dessa värden för att skapa en fördelning över alla platser.

Mått för att jämföra fixeringskartor. För mått som jämför två fixeringskartor, P och Q, följer vi noga 26. Vi använder tre distributionsbaserade mått: KL-divergens (KL), Pearson-korrelationskoefficient (CC) och Similarity (SIM), för att jämföra fördelningen av samplingsplatser från en modell med den från deltagarna som registrerats i de insamlade uppgifterna.

KL (definierad tidigare) är mycket känslig för nollvärden.

CC kan utvärdera det linjära sambandet mellan två kartor som26: CC(P, Q)=σ (P, Q) σ (P)σ (Q), där σ är variansen eller kovariansen. Eftersom CC är symmetrisk, kan den inte sluta sig till om skillnader mellan fixeringskartor beror på falska positiva eller falska negativa.

SIM mäts som 26: SIM(P, Q)=k min(Pk, Qk), där k Pk=k Qk=1. Liksom CC är SIM symmetriskt och ärver samma nackdel. SIM är också mycket känsligt för saknade värden och straffar förutsägelser som misslyckas med att ta hänsyn till sanningsdensiteten.

Människo- och djurforskning.

Den institutionella granskningsnämnden vid University of Memphis har fastställt att denna studie inte uppfyller Office of Human Subjects Research Protections definition av forskning om mänskliga subjekt och 45 CFR del 46 gäller inte. Därför kräver denna studie inte IRB-godkännande eller granskning.

Experimentella resultat Dataanalys.

De insamlade data kan visualiseras i termer av distributionssekvensen för utvalda platser (fig. 3), valda klasser (fig. 2) och varaktighet mellan på varandra följande episoder (fig. 2). Dessa distributioner är mycket lika för de tre datamängderna. För alla siffror eller alfabet, liknar fördelningen av utvalda platser efter det sista avsnittet fördelningen av pixelintensiteter för dess klass från datamängden. Sekvensen av valda platser är dock stokastisk till sin natur. Klassfördelningen indikerar förvirring mellan kategorier med liknande strukturer i de första avsnitten när deltagarna väljer flera klasser. Denna förvirring minskar med mer provtagning. Det finns en signifikant positiv korrelation mellan graden av förvirring (# valda klasser/totalt # klasser) och provtagningens varaktighet (se fig. 4). Om antalet valda klasser är högt (lågt), är varaktigheten mellan på varandra följande episoder hög (låg). CC för sekvensen av platser som valts av en deltagare för en klass är inte signifikant (tabell 1). Detta förväntas på grund av variabilitet mellan individer vid provtagning av statiska bilder. Det genomsnittliga antalet provtagningar som krävs av en deltagare för att exakt förutsäga en klass är ganska lågt. I genomsnitt tar det 4,2, 4,7 och 4,9 sampel motsvarande 36, 44,1 och 48,1 sekunder för att korrekt klassificera MNIST, EMNIST versaler respektive gemener. Deltagarna såg i genomsnitt endast 11,3 %, 13,4 % och 13,7 % av bildytan för att korrekt klassificera en bild med siffror, versaler och gemener (se fig. S2 i tilläggsmaterialet). Dessa resultat framhäver effektiviteten hos det mänskliga visuella resonemangssystemet, om än med en lägre upplösning än ögonspårningsdata men med mindre brus och variation. Dessa empiriska resultat kan vara användbara för att designa uppmärksamhetsbaserade modeller för verkliga tillämpningar. Beteendeförutsägelse. I det här avsnittet utvärderas prestandan för vår baslinjemodell i termer av hur exakt den kan förutsäga varje deltagares plats och klassval. Eftersom våra experimentella resultat med de två framträdande poängfunktionerna, KL-divergens och skillnad, är ganska lika, rapporteras resultaten endast med hjälp av skillnad, om inte annat anges. Klassförutsägelse. Klassprediktionen och dess noggrannhetsutvärderingsmetoder beskrivs i avsnittet "Klassprediktion". Klassprediktionsnoggrannheten, som visas i fig. 5, beräknas över alla klasser för alla samplingar. Den genomsnittliga klassprediktionsnoggrannheten över alla provtagningar och datauppsättningar är 74,4 % (standardavvikelse 26,5). Figurerna 5a och b visar att uppsättningen klasser som valts ut av deltagarna och av vår baslinjemodell (Ekv. 2) är ganska felaktiga vid de första episoderna och förbättras med ökningen av prover. Figur 5c visar att under de första episoderna är dessa två uppsättningar, ct och ˆct, ganska olika; likheten ökar med en ökning av proverna. Detsamma gäller för nya klassval (ref. Fig. 5f). Emellertid är klassavslag liknande vid de första episoderna; likheten ökar ytterligare med fler prover (ref. Fig. 5e). Eftersom J(st, ˆst)=|(ct ∩ ˆct) − ct−1| |(ct ∪ ˆct) − ct−1| och J(rt, ˆrt)=|ct−1 − (ct ∪ ˆct)| |ct−1 − (ct ∩ ˆct)|, kan man sluta sig till fig. 5e, f att vid de inledande episoderna är skärningspunkten mellan ct−1 och ct ∪ ˆct liten, vilket indikerar att deltagarna initialt och vår baslinjemodell göra många förändringar i sitt klassval mellan på varandra följande avsnitt. Därför är klassurvalsprocessen initialt mycket stokastisk. Även om det finns vissa skillnader mellan deltagarnas och vår modells klassförutsägelse under de första avsnitten, blir beteendena allt mer lika med fler prover. Under de första (vanligtvis 4 till 7) episoderna avslöjas mycket framträdande delar av ett stimulus. Detta hjälper till att endast välja rätt klass i de senare provtagningarna, vilket ökar prediktionsnoggrannheten. Eftersom det finns många klasser vars medelmallar matchar de observerade delarna av stimulansen under de första avsnitten, är klassurvalsprocessen betydligt mer stokastisk, vilket leder till låg klassificeringsnoggrannhet från såväl deltagarna som vår modell.

Figure 3. Distribution of sampling locations over all participants for each numeral/alphabet class and each sampling episode. Each row corresponds to a class, each column corresponds to a sampling episode which increases from left to right.


Figur 3. Fördelning av provtagningsplatser över alla deltagare för varje siffer-/alfabetklass och varje provtagningsavsnitt. Varje rad motsvarar en klass, varje kolumn motsvarar en samplingsepisod som ökar från vänster till höger.

Platsförutsägelse. Vår baslinjemodells (Ekv. 3) lägespredikteringsnoggrannhet, i genomsnitt över alla provtagningar och datauppsättningar, är 67,7 % (standardavvikelse 14,1) (ref. Fig. 5d). Trenden för denna prediktionsnoggrannhet är motsatt den för klassprediktionsnoggrannhet. Men förklaringen är densamma. Platsförutsägelsenoggrannheten är hög under de initiala provtagningarna eftersom under dessa episoder väljs de mycket framträdande platserna, vilket lämnar de mindre framträdande platserna att väljas i de senare avsnitten. Eftersom det finns många platser med låg framträdande karaktär är deras urvalsprocess mycket stokastisk och därför svår att förutsäga, vilket leder till en minskning av prediktionsnoggrannheten med en ökning av provtagningar. Den minskande trenden är unik för varje datauppsättning (ref. Fig. 5d) eftersom antalet klasser och antalet mycket framträdande platser som är användbara för diskriminering varierar mellan datauppsättningar. Ju lägre antal klasser och mycket framträdande diskriminerande platser är, desto snabbare kommer minskningen i platsförutsägelseprecision att gå med en ökning av provtagningar.

imageFigure 4. (Lef) Errorbar plot of time diference (seconds) between consecutive samples averaged over all classes. Tat is, value shown at sampling episode t is the time elapsed between a participant's clicks in image at t − 1 and t. (Right) Errorbar plot of confusion averaged over all classes at each episode. Errorbars indicate std. dev.

Figur 4. (Vänster) Errorbar-plot över tidsskillnaden (sekunder) mellan på varandra följande sampel, medelvärde över alla klasser. Tat är att värdet som visas vid provtagningsepisoden t är tiden som förflutit mellan en deltagares klick på bilden vid t − 1 och t. (Höger) Errorbar plot av förvirring i genomsnitt över alla klasser vid varje avsnitt. Felfält indikerar std. dev.

Figure 5. Evaluation of our baseline model (ref.

Figur 5. Utvärdering av vår baslinjemodell (ref. avsnittet "Baslinje för beteendeförutsägelse"). (a) Klassificeringsnoggrannheten (enligt) för deltagarna och (b) den för vår baslinjemodell med faktiska etiketter som grundsanning. (c) Klassificeringslikhet (J(ct, ˆct)), (d) platsförutsägelsenoggrannhet, (e) klassavvisningsnoggrannhet och (f) klassvalsnoggrannhet för vår baslinjemodell med deltagarnas data som grundsanning. Se avsnittet "Beteendeförutsägelse" för detaljer.

Table 1. Average Pearson correlation coefficient (corr.) for fxation sequences for the same class. For any fixation, distance is Euclidean and direction is measured as the polar angle with respect to the center of stimuli as the origin. Std. dev. are included in parenthesis.


Tabell 1. Genomsnittlig Pearson-korrelationskoefficient (korr.) för fixationssekvenser för samma klass. För varje fixering är avståndet euklidiskt och riktningen mäts som den polära vinkeln med avseende på centrum av stimuli som ursprung. Std. dev. ingår inom parentes.

Utvärdering av RAM.

För varje klass och provtagning jämförs fixeringskartorna från RAM (vi använde RAM-implementeringen från github.com/hehefan/Recurrent-Attention-Model) och de insamlade data för samma stimuli som presenteras i MTurk. För en rättvis jämförelse med deltagarna, i RAM fixerade vi sekvenslängden till T=12, den första samplingsplatsen i bildens centrum, ingångsobservationen till en 5×5 patch med den valda platsen som centrum, och modifierade belöningsfunktionen med ekv. (1). Den kumulativa belöningen, Rt i ekv. (4,) ersätts av den kumulativa poängen t τ=1 Pτ erhållen från ekv. (1). Eftersom en deltagare kan välja flera klasser vid vilken episod som helst, för RAM-modellen, istället för att förutsäga en enda klass baserat på högsta sannolikhet, betraktar vi medelsannolikheten över alla klasser som en tröskel och förutsäger uppsättningen klasser ct med sannolikheter större än tröskel. Denna ct används för att beräkna poängen med Ekv. (1). Under dessa förhållanden kräver RAM 3,7, 8,5 och 7,6 sampel för att känna igen MNIST-siffror, versaler och gemener EMNIST-alfabet, vilket motsvarar 8,9%, 21,0% respektive 18,7% av bildytan. I jämförelse med våra deltagare (ref. avsnittet "Dataanalys") är RAM-minnet mindre effektivt. Se tabell 2. Resultat från jämförelse av fixeringskartorna från RAM och insamlad data visas i tabell 3. KL är högre på grund av dess känslighet för nollvärden. Detta innebär att flera platser samplas av deltagarna men inte av RAM. Dessa experiment kan användas som en baslinje för att utvärdera platser som provats av en uppmärksamhetsmodell.

cistanche-Improve memory2

cistanche fördelar - Förbättra minnet

Diskussioner

mcAT-paradigmet, som det används i denna artikel, har vissa punkter som skiljer sig från de som i första hand förlitar sig på ögonrörelser och blickar för att studera mekanismerna för objektigenkänning. I den senare lockar framträdande delar av scenen uppmärksamhet först, följt av saccadiska ögonrörelser som riktar blicken mot de framträdande platserna27. Gaze drivs av bottom-up- och top-down-signaler som tillsammans med framträdande information bildar prioriterade kartor som styr ögonrörelser för objektigenkänning. Eftersom deltagarna i denna studie tittade på de statiska bilderna under fria förhållanden och med gott om tid till hands (sex minuter för T=12-provtagningar), ägnade de sig sannolikt åt en serie sackadiska ögonrörelser eller visuella resonemang28 för att utforska bilden innan du klickar på en AOI. Dessa ögonrörelser kunde ha fångats i emAT (med en eyetracker) men inte i mcAT. Dessa ögonrörelser påverkas dock av sinnesvandring. Även om mcAT också påverkas av tankevandring29, kan effekten minska när deltagarna svarar efter visuella resonemang. Eftersom ögonrörelser som svar på en stimulans påverkas av den aktuella uppgiften30, påverkades sannolikt deltagarnas ögonrörelsemönster av den tilldelade trestegsuppgiften vid varje provtagning (ref. avsnittet "Visuell uppgift"). Om en eyetracker hade använts, skulle deltagarnas ögonrörelser för att utforska provet ha blandats med ögonrörelser för att klicka på sina valda klasser, vilket skulle ha komplicerat tolkningen av den visuella utforskningen av provet. Att klicka på klasserna är ett nödvändigt steg eftersom det avslöjar, om än introspektivt, de förutspådda klasserna i en deltagares sinne. Det är troligt att blickarna omedelbart före och efter AOI-valet – kanske också med hjälp av fixerande ögonrörelser{10}}bidrog mest till siffer-/alfabetigenkänningen. I själva verket antar vi att deltagarna valde diagnostiska områden i bilden för att skilja mellan klasser, och dessa områden innehåller sannolikt en blandning av nedifrån och upp (t.ex. visuell kontrast) och top-down (siffror/alfabetmall) diagnostisk information. Detta överensstämmer med vår upptäckt att deltagarna snabbt (inom 5 prover i genomsnitt) särskiljde mellan stimulusklasser till synes genom att välja diagnostiska plåster.

Table 2. Comparison of efficiency between our participants and the RAM model in terms of the average number of samples required to recognize a numeral/alphabet. The percentage of the image area observed is included in parentheses.

Tabell 2. Jämförelse av effektivitet mellan våra deltagare och RAM-modellen när det gäller det genomsnittliga antalet prover som krävs för att känna igen en siffra/alfabet. Procentandelen av bildytan som observeras är inkluderad inom parentes.

Table 3. Evaluation of fixation maps from RAM for the stimuli presented in the MTurk experiments averaged over all classes and samplings. Std. dev. are included in parenthesis.


Tabell 3. Utvärdering av fixeringskartor från RAM för de stimuli som presenterades i MTurk-experimenten beräknat i genomsnitt över alla klasser och provtagningar. Std. dev. ingår inom parentes.

Slutsatser

Vi introducerade en mcAT-datauppsättning för att känna igen handskrivna siffror och alfabet via sekventiell sampling. Data samlas in från 382 deltagare presenterade med bilder valda från benchmark-datauppsättningar (MNIST, EMNIST). I genomsnitt registreras 169,1 svar per siffer-/alfabetklass. Data analyseras noggrant för att avslöja effektiviteten av mänsklig visuell igenkänning. Deltagarna observerade endast 12,8 % av en bild för igenkänning. Vi föreslog en baslinjemodell för att förutsäga plats och klass(er) en deltagare skulle välja vid nästa provtagning. Vi visade hur våra experimentella förhållanden och data kan användas för att utvärdera en uppmärksamhetsbaserad förstärkningsmodell i jämförelse med mänsklig prestation. Denna mcAT-datauppsättning, med flera fördelar jämfört med eyetracking-data, fyller en avgörande lucka i uppmärksamhetsbaserad modellforskning inom AI, ML och andra områden.

Referenser

1. Ranzato, MA Om att lära sig var man ska leta. arXiv:1405.5488, (2014).

2. Ba, J., Salakhutdinov, RR, Grosse, RB, & Frey, BJ Att lära sig vakna-sömn återkommande uppmärksamhetsmodeller. I NIPS, 2593–2601 (2015).

3. Mnih, V. et al. Återkommande modeller av visuell uppmärksamhet. I NIPS, 2204–2212 (2014).

4. Ba, J., Mnih, V., & Kavukcuoglu, K. Multipel objektigenkänning med visuell uppmärksamhet. arXiv:1412.7755 (2014).

5. Dutta, JK & Banerjee, B. Variation i klassificeringsnoggrannhet med antal glimtar. I IJCNN, 447–453 (IEEE, 2017).

6. Larochelle, H. & Hinton, GE Lära sig kombinera foveala glimtar med en tredje ordningens Boltzmann-maskin. I NIPS, 1243–1251 (2010).

7. Elsayed, G., Kornblith, S. & Le, QV Saccader: Förbättring av noggrannheten hos hårda uppmärksamhetsmodeller för syn. I NIPS, 702–714 (2019).

8. van Beers, RJ Te källor till variabilitet i saccadiska ögonrörelser. J. Neurosci. 27(33), 8757–8770 (2007).

9. Itti, L. & Baldi, P. Bayesiansk överraskning väcker mänsklig uppmärksamhet. Vis. Res. 49(10), 1295–1306 (2009).

10. Egner, S. et al. Uppmärksamhet och informationsinhämtning: Jämförelse av musklick med uppmärksamhetsspårning av ögonrörelser. J. Eye Mov. Res. 11(6), (2018).

11. Peterson, MS, Kramer, AF & Irwin, DE Hemliga förändringar av uppmärksamhet föregår ofrivilliga ögonrörelser. Percept. Psykofys. 66(3), 398–405 (2004).

12. Jiang, M. et al. Silicon: Framträdande i sammanhanget. I CVPR, 1072–1080 (2015).

13. Kim, NW et al. BubbleView: Ett gränssnitt för crowdsourcing av kartor för bildviktighet och spårning av visuell uppmärksamhet. ACM Trans. Comput. Brum. Påverka varandra. 24(5), 1–40 (2017).

14. Sermanet, P., Frome, A. & Real, E. Uppmärksamhet för finkornig kategorisering. arXiv:1412.7054 (2014).

15. Egner, S., Itti, L. & Scheier, C. Jämföra uppmärksamhetsmodeller med olika typer av beteendedata. Undersök. Oftalmol. Vis. Sci. 41(4), S39 (2000).

16. Navalpakkam, V. et al. Mätning och modellering av öga-mus-beteende i närvaro av olinjära sidlayouter. I Proc. Int. Konf. WWW, 953–964 (2013).

17. Matzen, LE, Stites, MC & Gastelum, ZN Studera visuell sökning utan ögonspårare: En bedömning av artificiell foveation. Cogn. Res. Prins. Implicerad. 6(1), 1–22 (2021).

18. Tafi, AP et al. OCR som en tjänst: En experimentell utvärdering av Google Docs OCR, Tesseract, ABBYY FineReader och Transym. I Int. Symp. Vis. Comput., 735–746 (Springer, 2016).

19. Memon, J., Sami, M., Khan, RA & Uddin, M. Handwritten optical character recognition (OCR): A comprehensive systematisk litteraturöversikt (SLR). IEEE Access 8, 142642–142668 (2020).

20. Chaudhuri, A., Mandaviya, K., Badelia, P. & Ghosh, SK Optiska teckenigenkänningssystem. I optiska teckenigenkänningssystem för olika språk med Sof Computing, 9–41 (Springer, 2017).

21. LeCun, Y. et al. Gradientbaserat lärande tillämpas på dokumentigenkänning. Proc. IEEE 86(11), 2278–2324 (1998).

22. Cohen, G., Afshar, S., Tapson, J. & van Schaik, A. EMNIST: En förlängning av MNIST till handskrivna brev. arXiv:1702.05373, (2017).

23. Gregor, K., Danihelka, I., Graves, A., Rezende, D. & Wierstra, D. DRAW: Ett återkommande neuralt nätverk för bildgenerering. I ICML, 1462–1471 (2015).

24. Friston, K. Te free-energy princip: A rough guide to the brain?. Trender Cogn. Sci. 13(7), 293–301 (2009).

25. Mirza, MB, Adams, RA, Friston, K. & Parr, T. Introduktion av en Bayesiansk modell för selektiv uppmärksamhet baserad på aktiv slutledning. Sci. Rep. 9(1), 1–22 (2019).

26. Bylinskii, Z., Judd, T., Oliva, A., Torralba, A. & Durand, F. Vad säger olika utvärderingsmått för oss om framträdande modeller? IEEE Trans. Mönster Anal. Mach. Intell. 41(3), 740–757 (2018).

27. Itti, L. & Koch, C. Beräkningsmodellering av visuell uppmärksamhet. Nat. Rev. Neurosci. 2(3), 194–203 (2001).

28. Lamme, VAF Visuella funktioner som genererar medveten seende. Främre. Psychol., 11, (2020).

29. da Silva, MRD & Postma, M. Vandrande sinnen, vandrande möss: Datormusspårning som en metod för att upptäcka sinnesvandring. Comput. Brum. Behav. 112, 106453 (2020).

30. Schütz, AC, Braun, DI & Gegenfurtner, KR Ögonrörelser och perception: En selektiv recension. J. Vis. 11(5), 9–9 (2011).

31. Intoy, J. & Rucci, M. Finjusterade ögonrörelser förbättrar synskärpan. Nat. Commun. 11(1), 1–11 (2020).

Du kanske också gillar