{"as_of":"2026-08-16T11:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:acd1f22df2a1f6ca638006205afee4595e9d257c5673e2d55595b8f24c1788af","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T11:42:17.143124Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.08498/citation-record","integrity":"/paper/1908.08498/integrity","json":"/paper/1908.08498/citation-record.json","paper":"/paper/1908.08498"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.708046Z","title":"Marks, Dhruv Batra, and Devi Parikh","venue":null,"work_id":"4b5bc49d-47ee-4cea-b2be-11bea593db0a","year":2018},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:16.961957Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:f7a6efde26afb1469fbc4cd7ff38bd4bd2b52c95be043426171c1dbda2e8085e","observation_id":"f73a44c0-6edf-46fd-8a87-6c16b7d830ab","resolution":{"observed_at":"2026-08-14T11:42:17.711556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.697344Z","title":"Look, listen and learn","venue":null,"work_id":"3f8b35c0-9a33-4610-af13-db3c75d23515","year":2017},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:16.966433Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:3e6f338d8b03b3ca482d34bd45164dd80b7ac76e2d911e026e3f8cb5e78f0d67","observation_id":"f507b03a-4a33-48d1-a1af-9f7576cec44e","resolution":{"observed_at":"2026-08-14T11:42:17.700882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.686284Z","title":"Objects that sound","venue":null,"work_id":"71c0543f-b0f2-4e1e-87fa-1258bf4bd19e","year":2018},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:16.970388Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:5652788913f84d9835ab1a3bc488fec5ecf7293ae7dba897d2c71afe36316e04","observation_id":"a7717a83-00e9-4c8a-9478-3a5de4fe5fa7","resolution":{"observed_at":"2026-08-14T11:42:17.690218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.675863Z","title":null,"venue":null,"work_id":"359c3e11-3a0f-4dc0-a373-a87989b7cd24","year":2017},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:16.974662Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:8f5110d3d80171a2f8439840d9c43f299fe56e686ce3deb25ead92314e07297a","observation_id":"648b9cea-bdb1-4a00-879c-d6484c5bb0c4","resolution":{"observed_at":"2026-08-14T11:42:17.679363Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.664138Z","title":"Sound- net: Learning sound representations from unlabeled video","venue":null,"work_id":"bd51404f-a5f5-4423-9573-341dc31cbefe","year":2016},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:16.978881Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:971ae8f4784f8e63bf08805f2f609566d44d345d4a7af7384cca48961bb232ee","observation_id":"45e2ae57-b330-4b4b-ad0f-044b5b553544","resolution":{"observed_at":"2026-08-14T11:42:17.668339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.00932","last_updated":"2017-06-03T11:11:13Z","snapshot_observed_at":"2026-08-14T20:56:19.463168Z","submitted_at":"2017-06-03T11:11:13Z","title":"See, Hear, and Read: Deep Aligned Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.00932","snapshot_observed_at":"2026-08-14T11:42:16.982899Z","title":"See, hear, and read: Deep aligned representations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:16.982899Z"},"links":{"cited_paper":"/paper/1706.00932","citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:054caa10ba2563906e68a82061c6e5b2e9868ef67a9022066b28c194b1f6a6e1","observation_id":"d5b7c46b-6f31-482e-8781-75216024ba46","resolution":{"observed_at":"2026-08-14T11:42:16.982899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:16.987283Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:16.987283Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:865cdea51fb0e9ad80c5c2400b7dc66b21dc8737f73755d0da57a16e4ec00a6a","observation_id":"d3730eca-53e6-439f-88e5-89cc5c122619","resolution":{"observed_at":"2026-08-14T11:42:16.987283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.646503Z","title":"Scaling egocentric vision: The epic-kitchens dataset","venue":null,"work_id":"f47cfd5e-26e3-4374-b472-3cf4ba21ed80","year":2018},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:16.990652Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:82e7d4e161a4aaeff0f730efaa98af074d97335c4e89bab8b72e1f27b84ea2e0","observation_id":"d43234d2-4211-41b4-8856-6a39c3632cea","resolution":{"observed_at":"2026-08-14T11:42:17.650224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.635497Z","title":"You-do, i-learn: Dis- covering task relevant objects and their modes of interaction from multi-user egocentric video","venue":null,"work_id":"40d6a367-cd18-4532-93d3-4fbaf0b1e69b","year":2014},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:16.994240Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:2919d9ae8bac471f8e4180f5900adfaa6be5208b479df56522d01bfac5a59d09","observation_id":"1d0b1a0e-4382-4fcd-8791-0241fa161cc6","resolution":{"observed_at":"2026-08-14T11:42:17.639524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.624906Z","title":"Convolutional two-stream network fusion for video action recognition","venue":null,"work_id":"883c8c3e-e55c-40e8-a955-b2cfee791c4e","year":2016},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:16.997707Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:3fe671667145ee0934ac980209645b092eae98c321d4b645fa276b7ef9ad6183","observation_id":"b54bf346-29fa-4841-846d-9d22f9df875a","resolution":{"observed_at":"2026-08-14T11:42:17.628818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.614367Z","title":"2.5D visual sound","venue":null,"work_id":"b6f0bade-c5d1-4cfd-9f59-a75ccddbe907","year":2019},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.001107Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:339da729e1ad116c4c530d759facbfd8aeb5d8e66592db826a109c3e4d6a4103","observation_id":"525ef33c-b6b3-41f0-84ad-98630d648835","resolution":{"observed_at":"2026-08-14T11:42:17.618121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.603554Z","title":"A better baseline for ava","venue":null,"work_id":"60a82275-3c98-4a12-80b7-ab663883b0d7","year":2018},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.004731Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:a1f93b298152413a62dfc24a3de46c2b4355b8c83b6145346e5d45dfbaae863d","observation_id":"955051d1-e517-4dde-b28d-581ab002c54b","resolution":{"observed_at":"2026-08-14T11:42:17.607612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.592840Z","title":"Actionvlad: Learning spatio-temporal aggregation for action classiﬁcation","venue":null,"work_id":"e46be210-9d54-42a8-b2c2-2ea75d0e855f","year":2017},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.008577Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:71788c3dbe63bbb105d800628c1800b4553aa2136433d2bca99e363b14aea543","observation_id":"c7cd2c25-5b6a-4608-a1e2-56ff25f49e68","resolution":{"observed_at":"2026-08-14T11:42:17.596633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.581998Z","title":"Batch normalization: Accelerating deep network training by reducing internal co- variate shift","venue":null,"work_id":"9e53bb0b-b89a-48c9-b00c-13be0489703f","year":2015},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.012087Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:805890b6226f1111735e1ff54b289939ed1067e77c2851544d1b09364690f21f","observation_id":"81646e5d-b341-4eb8-a624-8924400538f9","resolution":{"observed_at":"2026-08-14T11:42:17.585870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.570468Z","title":"Aggregating local descriptors into a compact image representation","venue":null,"work_id":"7477329a-cde4-4691-bf38-7a1416991c28","year":2010},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.015510Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:4b3b02f791abab890c5dbdc22bbf58718f5a06f022cb133d275cff2e59f97928","observation_id":"afddea73-4a29-4f76-8bb8-bf3961bb15a0","resolution":{"observed_at":"2026-08-14T11:42:17.574685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.559879Z","title":"Coopera- tive learning of audio and video models from self-supervised synchronization","venue":null,"work_id":"418abb57-7f14-46a1-b81f-e37415778130","year":2018},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.019107Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:93bf5c4b6894fb8180cff78504f451658707e9705e86e7f1587078cc52bf4ab5","observation_id":"f413f42c-4e89-4a65-b083-c26775a28ce7","resolution":{"observed_at":"2026-08-14T11:42:17.563833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.549117Z","title":"Lee, Joydeep Ghosh, and Kristen Grauman","venue":null,"work_id":"2473db19-7029-4e74-8617-0c83cbbde501","year":2012},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.022496Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:f19a1dc225d84bc3834e906d028d0c985de8ab8df36fdc444f0717ee9dd55ee8","observation_id":"edd38687-278f-4f1e-9d30-8d623e979bd3","resolution":{"observed_at":"2026-08-14T11:42:17.552846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.538778Z","title":"Action recognition with coarse-to-ﬁne deep feature integration and asynchronous fusion","venue":null,"work_id":"c38c27dc-3be9-4b8d-b32f-0f076b3b6da3","year":2018},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.025695Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:b2ceb9d51e313cf36ef69d216a296f8505d19995f10729ba72a308a5a7feb2ac","observation_id":"ee1db7b5-867a-4d43-9fb4-a987736118ff","resolution":{"observed_at":"2026-08-14T11:42:17.542364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.528137Z","title":"Attention clusters: Purely attention based local feature integration for video classiﬁcation","venue":null,"work_id":"dc750500-bbf9-4211-9ff8-3e1db97adb31","year":2018},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.029042Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:7bedade677f79f25ca399c7f959c16492e61520bbab3ac534682bb62db110cf4","observation_id":"dbde318f-b4a2-4563-a48a-316d145c70e0","resolution":{"observed_at":"2026-08-14T11:42:17.532137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.517206Z","title":"Multimodal keyless attention fu- sion for video classiﬁcation","venue":null,"work_id":"1597307a-311a-4f92-abf9-44e44a7ec2a4","year":2018},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.032307Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:cb6f46529127355a11441337ba4fa3d686e2455900de762972f5ee9c371ac660","observation_id":"5ecba0ee-2022-4598-b26b-2308b14ea9ac","resolution":{"observed_at":"2026-08-14T11:42:17.521299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.506281Z","title":null,"venue":null,"work_id":"32aa6eec-91fe-4403-a049-1a5a2f50df99","year":2016},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.036032Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:ba59ce6eac6fb73f04fccc2d6d3b742e080209646df11ca8d77967489eb3a798","observation_id":"58810683-2f2e-4dd1-a8e0-db83f9674fbf","resolution":{"observed_at":"2026-08-14T11:42:17.510068Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.06905","last_updated":"2018-03-05T12:30:37Z","snapshot_observed_at":"2026-08-14T20:52:34.108757Z","submitted_at":"2017-06-21T13:49:14Z","title":"Learnable pooling with Context Gating for video classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.06905","snapshot_observed_at":"2026-08-14T11:42:17.039447Z","title":"Learnable pooling with context gating for video classiﬁcation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.039447Z"},"links":{"cited_paper":"/paper/1706.06905","citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:7710be8d3cd2eab4db2eec3ff8bdf7d28d1e7530afb49516a237224dd03a9d20","observation_id":"b151ff87-a1e6-4ccc-9087-7074d042bba5","resolution":{"observed_at":"2026-08-14T11:42:17.039447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.495144Z","title":"Learning a Text-Video Embedding from Imcomplete and Heteroge- neous Data","venue":null,"work_id":"b9d186b8-fc4d-4e52-9ac6-e131fe7f0d8f","year":2018},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.043173Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:3efe67f6a59f47cff1d8b8161b2ef611a392c5bbfce78bd7bb123539e027ed98","observation_id":"ce4a1a7d-a71e-47a7-86de-c3546d69a761","resolution":{"observed_at":"2026-08-14T11:42:17.498779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.482897Z","title":"Trespassing the boundaries: Labeling temporal bounds for object interactions in egocentric video","venue":null,"work_id":"6d9d299f-3f72-40d4-89ac-7eed4b8d97be","year":2017},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.046520Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:63a38d7ac03844c6dbe86912356907ab5b26c579726f2043b46b4423f0ef8f7d","observation_id":"68d3854f-069c-41d5-921a-1e3cdd9bbbbb","resolution":{"observed_at":"2026-08-14T11:42:17.486769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.470719Z","title":null,"venue":null,"work_id":"3df0d125-413d-411d-ac66-297bcdfaebda","year":2013},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.049891Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:8168c61cff6f2b1a319ebbd3447a35bb3a23086cf4784c5f4eea25691009d96b","observation_id":"803d6211-781e-424e-a1f3-5178f26eeafb","resolution":{"observed_at":"2026-08-14T11:42:17.474724Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.458854Z","title":"Learnable PINs: Cross-modal embeddings for person iden- tity","venue":null,"work_id":"b1b22c18-f31d-46ba-9215-0c6a9fd2f503","year":2018},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.053294Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:071e1728858e4351c3ad3ac54924d00352bedbeae89223e309eae1e6dc9336cd","observation_id":"e0823041-0e54-45f7-905a-4d0578f8a5c2","resolution":{"observed_at":"2026-08-14T11:42:17.462889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.447127Z","title":"Seeing voices and hearing faces: Cross-modal biometric matching","venue":null,"work_id":"b66f1fcc-ad5c-4a60-9db3-e36bba1bea60","year":2018},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.056757Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:d609987641aa790b4cb5748fc1e17ba49a18418e77936bb4a23b4157e251354b","observation_id":"49c53088-f012-4926-80e8-7a2428cb8763","resolution":{"observed_at":"2026-08-14T11:42:17.451212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.434729Z","title":null,"venue":null,"work_id":"8ba27995-1531-4517-9c79-86c6a198c72d","year":2018},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.060452Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:afc9bf4979457ab5ea3f4c13a311936a24945f43ecac5f10d730b41eace19e1a","observation_id":"b9ad10bd-dd87-4738-bdad-330fd7457444","resolution":{"observed_at":"2026-08-14T11:42:17.438902Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.422506Z","title":"McDermott, William T","venue":null,"work_id":"ae06d4b6-79b7-472b-9f85-ebd35c6b84d3","year":2016},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.064171Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:12d88996a2f5e190fd06514bd919b22ea086559841f8e1fe1a1b52db2c643258","observation_id":"6999648c-8f20-4a86-8a21-d0b4a22f9faa","resolution":{"observed_at":"2026-08-14T11:42:17.427294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.410931Z","title":"Parise, Charles Spence, and Marc O","venue":null,"work_id":"727a72e1-d5f1-4f76-a939-35e10a8ae0ac","year":2012},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.067454Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:80a6f067bfb733afc4569fbd98dc4ff4688e81c3d4cb3042c9b9bbe421598111","observation_id":"54fc793e-8bca-43a3-a2c8-b79f37c72121","resolution":{"observed_at":"2026-08-14T11:42:17.414803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.071258Z","title":"Automatic differentiation in pytorch","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.071258Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:d168f588423d4c0d872c1e9df1119772abee68cf2f37a9d328e10f0eee8c4139","observation_id":"f7733d70-de37-485e-bf11-450ccece1d81","resolution":{"observed_at":"2026-08-14T11:42:17.071258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.392528Z","title":"Detecting activities of daily living in ﬁrst-person camera views","venue":null,"work_id":"9d503d51-ee67-4540-bdc9-394e3b2345e2","year":2012},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.074678Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:1322c5cc0906533e257f3bdcae0f389d7228be0820d4f5f781e685a2c4b2cb39","observation_id":"c8eafb09-cdd5-43e0-8afe-20060df13960","resolution":{"observed_at":"2026-08-14T11:42:17.396763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.381434Z","title":"On the momentum term in gradient descent learning algorithms","venue":null,"work_id":"76cd88ce-0b25-4f3f-abc6-3121538dba64","year":1999},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.078083Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:673ca7775f2bb216c2aa5207834118853e003d7be7f929bbb9eb47973b0f9e7d","observation_id":"86397973-2065-49a9-8f0f-d8fc870f0143","resolution":{"observed_at":"2026-08-14T11:42:17.385273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.081551Z","title":"Learning to localize sound source in visual scenes","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.081551Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:03750e8e0e705ffcd35ee9fef6430632ffa75882f12d6bcebf557eda69a9c66f","observation_id":"a4f7908f-9160-493f-bc94-09ceb4465e3f","resolution":{"observed_at":"2026-08-14T11:42:17.081551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.362845Z","title":"Sigurdsson, Abhinav Gupta, Cordelia Schmid, Ali Farhadi, and Karteek Alahari","venue":null,"work_id":"ec58e0a9-16b0-46da-8949-c49fd2beb691","year":2018},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.085056Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:d9dff9efd5d1b3a3d6650c7507d31f2740486d4b5358194d40d5ffff40c5c442","observation_id":"a247ace5-b185-4161-81a8-a2e969e99de1","resolution":{"observed_at":"2026-08-14T11:42:17.367418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.351147Z","title":"Two-stream con- volutional networks for action recognition in videos","venue":null,"work_id":"d2fe353a-7643-4a0d-b0b1-2d4dddeb34c5","year":2014},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.088931Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:8aeff224b60a0645f8905a0ed939e8de392751d7571b9ccb028c57c0e51b0408","observation_id":"2a6637e9-76b4-428a-bc69-cdd3da13176e","resolution":{"observed_at":"2026-08-14T11:42:17.355143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.339839Z","title":null,"venue":null,"work_id":"597d6b1c-f6bf-4971-b851-ea3593223bf8","year":null},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.093139Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:303e1dcb753002d58a6f0c7200e37cae0686798c5ee98cea680c65f4f81a9b84","observation_id":"1b864e2d-0357-4fc5-a1cc-a31ebfde3b39","resolution":{"observed_at":"2026-08-14T11:42:17.343785Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.327995Z","title":"Multimodal multi-stream deep learning for egocentric activity recognition","venue":null,"work_id":"a3379fee-c6e6-43d7-9f16-597bb7cc5431","year":null},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.097032Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:ea41b8cbbebdf5f88b9832340d76cb42be0742f28c8d12a5c1815dcae359dd7a","observation_id":"e44a9b0b-4dde-48be-b816-e8d4ab0df1b7","resolution":{"observed_at":"2026-08-14T11:42:17.332544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.317078Z","title":"Stevenson, Magdalena M","venue":null,"work_id":"d1684bb1-561e-453e-94f9-f2e21eb7f858","year":2013},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.100841Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:cfa887bce4aa9ebc6f219c6f09cd52ce1ff65b51f601a3e346fc6d8ae037f1ee","observation_id":"7791f371-2dfc-441c-b4dc-b50333e7fc48","resolution":{"observed_at":"2026-08-14T11:42:17.320800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.305185Z","title":"Attention is all we need: Nailing down object-centric attention for egocen- tric activity recognition","venue":null,"work_id":"1d7b29af-7a46-4cc0-83c2-70ce694943c1","year":2018},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.104424Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:5c06c15d16c25bf6542be3d1cd229bbef4a66e2098bda54c923f3dfbf953e515","observation_id":"bbf274c0-b462-42ae-aa9f-1d63774876fe","resolution":{"observed_at":"2026-08-14T11:42:17.309656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.293801Z","title":"Wallace and Ryan A","venue":null,"work_id":"b151a3ab-dc6b-4e14-acd4-15ac2b481616","year":2014},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.108152Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:3d1e97ae7cb59a3d437ea9784ece21bf2cd82f66bd3c4039a508310254c40f4e","observation_id":"b922ca98-43cb-4ba0-8cf7-21776c13e385","resolution":{"observed_at":"2026-08-14T11:42:17.297462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.282667Z","title":"Temporal segment networks: Towards good practices for deep action recogni- tion","venue":null,"work_id":"b9d98f82-3b72-4a8c-b295-8a015410fd5a","year":2016},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.111661Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:87d7f744ca2cac9b97ac9a7ac888042be2aee225b919e5a588195fdcf2026474","observation_id":"f8ac93bb-b1b1-49d2-a804-48a49f3eb0bd","resolution":{"observed_at":"2026-08-14T11:42:17.286556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.271121Z","title":"Multi-stream multi-class fusion of deep net- works for video classiﬁcation","venue":null,"work_id":"b230bc28-b093-46d0-ba3d-bfc5d3901578","year":2016},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.115293Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:74c821825bd29a5bb5ceb91aea796a840d13585428f3c7b6b171a8f22b78e850","observation_id":"0e4e5fd6-5d64-4260-81a8-ad280c3806cb","resolution":{"observed_at":"2026-08-14T11:42:17.275228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.260492Z","title":"Kitani, and Yoichi Sato","venue":null,"work_id":"b08b161a-dd8f-479c-9dc1-9ee5a32047f0","year":2016},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.119044Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:3226db8df16b3efc05889860ddb42cc85421e27f1e732e26d8cccd3b3a3a455c","observation_id":"5ab18872-76f8-44f1-8b80-3ccf373e562e","resolution":{"observed_at":"2026-08-14T11:42:17.264229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.248712Z","title":"Temporal relational reasoning in videos","venue":null,"work_id":"b6027ad9-1652-4224-9775-ce82fb7a7763","year":null},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.122907Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:f986fb3d81c990227f7812b70cde82ba8a3fa5436b00d8b76417b62e1772dccd","observation_id":"300f5b49-15a2-4410-a65b-045befc6b776","resolution":{"observed_at":"2026-08-14T11:42:17.252632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.237257Z","title":"Temporal perception and prediction in ego-centric video","venue":null,"work_id":"a5735855-9123-4bac-9b36-862ce1d23de7","year":2015},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.126621Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:2ba71bd4f20df8d0f5e2ca131bfd3aefd3fa07508a4556a333ff1bb49416a209","observation_id":"813c3319-1879-49d1-bfc3-d8d6fb247d4b","resolution":{"observed_at":"2026-08-14T11:42:17.241054Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.225141Z","title":"‘open’, ‘fridge’), as well as when all modalities are under-performing (e.g","venue":null,"work_id":"1c1c71ec-b4a3-44d0-93b7-71136fbab59b","year":null},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.130503Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:450201fac4b7e63d8e13f7f2bf5bb8689a93f7d4f3705b716f73d2c5f96decaa","observation_id":"4d62e0f6-607e-4d5b-8103-3d7fb3c52223","resolution":{"observed_at":"2026-08-14T11:42:17.230081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.214313Z","title":"‘divide’, ‘ﬁsh’)","venue":null,"work_id":"0d8fabde-df12-46ed-a9c0-cf0480399ec0","year":null},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.134902Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:d46dc5413c8ea31ef5e38122492defe50ec054ed658259dd3904dfa6d21b0067","observation_id":"40100b2b-e55c-4fb3-b21f-fff71038b1f6","resolution":{"observed_at":"2026-08-14T11:42:17.217851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.203552Z","title":"‘switch’, ‘paper’)","venue":null,"work_id":"15a32ddc-2d93-46d7-9fb1-6878564ed0cb","year":null},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.139550Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:6e87f983297b3875ad33574fc7143e60a299da46be53ed1d89045918dd864af2","observation_id":"779cbb46-6f57-4059-9506-e7e94c48e9ea","resolution":{"observed_at":"2026-08-14T11:42:17.207423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:42:17.191028Z","title":"‘chicken’, ‘salt’)","venue":null,"work_id":"843d242e-e16c-4f8a-859a-84cb91033e1b","year":null},"citing_paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T11:42:17.143124Z"},"links":{"citing_paper":"/paper/1908.08498"},"observation_digest":"sha256:4611655dfae715185e6d3e2399a07ed58dd202935636fc5bbcded6d77b8edddd","observation_id":"b4d2112d-9f85-41a8-b104-92833d310091","resolution":{"observed_at":"2026-08-14T11:42:17.195880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.08498","last_updated":"2019-08-22T17:07:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T11:35:39.332173Z","submitted_at":"2019-08-22T17:07:04Z","title":"EPIC-Fusion: Audio-Visual Temporal Binding for Egocentric Action Recognition"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":39},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:1908.08498."}