{"as_of":"2026-08-08T00:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ff946c465b3aa625fc29df2a0c77cb686d5ebf9712213edcedf8adeca10be6b9","coverage":[{"denominator":130,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:41:12.402302Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:09:15.243340Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T22:09:16.733694Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"cited_work":{"arxiv_id":"2506.21080","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.21080","snapshot_observed_at":"2026-08-05T22:09:16.733694Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","venue":"cs.CV","work_id":"e51b7022-bda4-463f-ac8e-d93742d15472","year":2025},"citing_paper":{"arxiv_id":"2508.07470","last_updated":"2025-08-21T16:39:49Z","snapshot_observed_at":"2026-08-07T09:50:14.288346Z","submitted_at":"2025-08-10T20:06:42Z","title":"AURA: A Fine-Grained Benchmark and Decomposed Metric for Audio-Visual Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T22:09:15.243340Z"},"links":{"cited_paper":"/paper/2506.21080","citing_paper":"/paper/2508.07470"},"observation_digest":"sha256:28b7f6d0ca85cf29ae7fe70268605d6c835de303017038c41e58d65e874e9452","observation_id":"bf48b8a6-817a-4536-915f-b4ca919a677b","resolution":{"observed_at":"2026-08-05T22:09:16.793393Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21080/citation-record","integrity":"/paper/2506.21080/integrity","json":"/paper/2506.21080/citation-record.json","paper":"/paper/2506.21080"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:03.970210Z","title":"Creating the future: Augmented reality, the next human-machine interface","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:03.970210Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:e8c5769ac17d4f105a612d4e45cc6e02736626af0a64c27ac6dd5baa5835e5b0","observation_id":"d2ca52a7-853b-4bde-929b-723ebbdd09fc","resolution":{"observed_at":"2026-08-06T22:41:03.970210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:04.033089Z","title":"Sound- net: Learning sound representations from unlabeled video","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:04.033089Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:a18229d9e72929170d2bc6034b429f349e0d3c5f4d97c4c0cd4b207c07717b5e","observation_id":"8ccefb28-4733-4054-9d2e-495b8a0bb1ca","resolution":{"observed_at":"2026-08-06T22:41:04.033089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06297","last_updated":"2016-01-07T22:41:10Z","snapshot_observed_at":"2026-08-04T23:18:10.428920Z","submitted_at":"2015-11-19T18:40:22Z","title":"Conditional Computation in Neural Networks for faster models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06297","snapshot_observed_at":"2026-08-06T22:41:04.119355Z","title":"Conditional computation in neural networks for faster models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:04.119355Z"},"links":{"cited_paper":"/paper/1511.06297","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:90d2aa697ddfe9869e87379e72a4bcfcdc08fe3df1c1100789a82a3624e3264b","observation_id":"4ac29ff8-2beb-4834-90f2-4eb4e03ff85e","resolution":{"observed_at":"2026-08-06T22:41:04.119355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-06T22:41:04.205025Z","title":"Estimating or propagating gradients through stochastic neurons for conditional computation","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:04.205025Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:2709a028274ed96c192da7b55fd22bf5913fe0e7145721dc08e474e34dce6b4b","observation_id":"a44e6997-86fe-4b49-bcef-87bb490330c4","resolution":{"observed_at":"2026-08-06T22:41:04.205025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:04.249702Z","title":"Knowledge distillation: A good teacher is patient and consistent","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:04.249702Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:0a0ad287dfeb4187e45cad5fc9549a9b9936c2a1e270c73968690524d8b0fa0e","observation_id":"89220d71-92b2-400f-bfa6-4ac7a63e0edb","resolution":{"observed_at":"2026-08-06T22:41:04.249702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:04.309397Z","title":"Tim: A time interval ma- chine for audio-visual action recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:04.309397Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:1184623efd45ca948001ee530c2e1ad96863cb7a714e28203287b2a0dc26f63b","observation_id":"d6ea68f2-7b7a-45cf-aba4-9db5ae48c844","resolution":{"observed_at":"2026-08-06T22:41:04.309397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:04.375703Z","title":"Se- mantic audio-visual navigation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:04.375703Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:5df87f3466127238d9583e03345b8e8cb736857100604ce66f3ef47a3e26d3f0","observation_id":"d6dfae1d-c305-44ed-8d23-5e5fef0a0fcf","resolution":{"observed_at":"2026-08-06T22:41:04.375703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:04.471202Z","title":"Run, don’t walk: chasing higher flops for faster neural networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:04.471202Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:f07d3febdd1d129e4376e843e486d8d4ea9cf3f1f5ae604744e5e7ffc0dd62cf","observation_id":"66efb008-1655-4c47-bdc4-a39d2d4b6672","resolution":{"observed_at":"2026-08-06T22:41:04.471202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:04.544147Z","title":"Eyeriss v2: A flexible accelerator for emerging deep neural networks on mobile devices","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:04.544147Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:90bee6ae0928fa8ceb6ad61dd4764b6680f755fe4028520e4c165b8b5a4481bd","observation_id":"1c70083d-7f8f-448d-a407-dde7974d1af6","resolution":{"observed_at":"2026-08-06T22:41:04.544147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:04.583491Z","title":"You look twice: Gaternet for dynamic filter selection in cnns","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:04.583491Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:a54a63058b3baf837cb7832b18f98dde3cd9da8e79ef005af8e47ac6d9aa22e1","observation_id":"ec93ff00-4cff-4c78-8c25-ecbc0df910ab","resolution":{"observed_at":"2026-08-06T22:41:04.583491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:04.658822Z","title":"Listen to the pixels","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:04.658822Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:52597f24040b9fc762d8125c67fd7455b4506b2a29b4ea595fce9d1dd1adab3a","observation_id":"2141c69d-e069-473e-9771-993fff19045d","resolution":{"observed_at":"2026-08-06T22:41:04.658822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:04.736166Z","title":"Audvisum: Self-supervised deep reinforcement learning for diverse audio-visual summary generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:04.736166Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:95be03896f689bdfbeee6c4578934eb24ee70639c6e9ec7740e2dc2f9959b4bd","observation_id":"68c8583f-0df7-4bee-853e-3202f8d4e75a","resolution":{"observed_at":"2026-08-06T22:41:04.736166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:04.792990Z","title":"Adverb: Visually guided audio dereverberation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:04.792990Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:17ad1352bbe00414e42b5daeacdbd5b4201a6c2401e108b593f8dc4596d8764f","observation_id":"737167be-817c-4eff-aec8-883f217631d9","resolution":{"observed_at":"2026-08-06T22:41:04.792990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01564","last_updated":"2023-12-04T01:42:09Z","snapshot_observed_at":"2026-08-07T00:34:58.061450Z","submitted_at":"2023-12-04T01:42:09Z","title":"APoLLo: Unified Adapter and Prompt Learning for Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01564","snapshot_observed_at":"2026-08-06T22:41:04.842354Z","title":"Apollo: unified adapter and prompt learning for vision lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:04.842354Z"},"links":{"cited_paper":"/paper/2312.01564","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:d7b420f3513514e61096f2a914a5d4c16e2f09d2cbbf893eedebed0aaa882df5","observation_id":"5e5fddc6-2751-497d-ac10-6984082d6c25","resolution":{"observed_at":"2026-08-06T22:41:04.842354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:04.880083Z","title":"Meerkat: Audio-visual large language model for grounding in space and time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:04.880083Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:bc48355b2bff6a87b9323230a224b87d77264b10c6fcc9a15956c2c6f6257406","observation_id":"c58ceba8-63f9-4faf-a808-73b0a9222212","resolution":{"observed_at":"2026-08-06T22:41:04.880083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:04.940528Z","title":"Melfusion: Synthesizing music from image and language cues using diffusion mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:04.940528Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:cad09918112657f7ec0fab554594067fd20f58eea07099b3ba8a24964b4bd626","observation_id":"2a8b9dd4-3ee9-4bf4-803b-0cb63ff25dbf","resolution":{"observed_at":"2026-08-06T22:41:04.940528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07016","last_updated":"2025-06-13T19:05:47Z","snapshot_observed_at":"2026-08-07T11:48:30.543139Z","submitted_at":"2025-06-08T06:34:29Z","title":"MAGNET: A Multi-agent Framework for Finding Audio-Visual Needles by Reasoning over Multi-Video Haystacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07016","snapshot_observed_at":"2026-08-06T22:41:05.001058Z","title":"Magnet: A multi-agent framework for finding audio-visual needles by reasoning over multi-video haystacks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:05.001058Z"},"links":{"cited_paper":"/paper/2506.07016","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:4903244a8087da8095793a0e3c2c6c14ae77ba9421244b7a3813d359baf67136","observation_id":"b7e657f6-9660-4ad7-a8ed-513e02acdef8","resolution":{"observed_at":"2026-08-06T22:41:05.001058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23219","last_updated":"2025-03-29T20:42:29Z","snapshot_observed_at":"2026-08-07T16:28:09.727905Z","submitted_at":"2025-03-29T20:42:29Z","title":"Aurelia: Test-time Reasoning Distillation in Audio-Visual LLMs","version":1},"cited_work":{"arxiv_id":"2503.23219","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.23219","snapshot_observed_at":"2026-08-06T22:41:15.038788Z","title":"Aurelia: Test-time Reasoning Distillation in Audio-Visual LLMs","venue":"eess.AS","work_id":"9625c50c-737c-4f99-a495-193bc886979f","year":2025},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:05.060780Z"},"links":{"cited_paper":"/paper/2503.23219","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:ca51e87a5fc0f2df0e9ec43f11ff57eccc8311bc0c78baf74bea8718eff1dfb1","observation_id":"5b659cf2-14de-4b75-95d7-cc11c4e4ae10","resolution":{"observed_at":"2026-08-06T22:41:15.100119Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02135","last_updated":"2025-01-03T23:03:24Z","snapshot_observed_at":"2026-07-06T20:16:27.318761Z","submitted_at":"2025-01-03T23:03:24Z","title":"AVTrustBench: Assessing and Enhancing Reliability and Robustness in Audio-Visual LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02135","snapshot_observed_at":"2026-08-06T22:41:05.113373Z","title":"Avtrustbench: Assessing and enhancing re- liability and robustness in audio-visual llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:05.113373Z"},"links":{"cited_paper":"/paper/2501.02135","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:d65dab006d00bd17d133f222a7ac8d77ce10005dd3e61d294f1d7d102c60bad9","observation_id":"3d4c15d4-49e6-4aea-9529-69d0ef60c2b1","resolution":{"observed_at":"2026-08-06T22:41:05.113373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:05.194536Z","title":"Rescaling egocentric vision: Collection, pipeline and chal- lenges for epic-kitchens-100","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:05.194536Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:d79eb90ccaf2ef18bcbbae32bdb7751caeab8ff41eb1f6d43b58da12a91064b4","observation_id":"78d4d67a-a9ff-4445-b8c0-02a157896b2a","resolution":{"observed_at":"2026-08-06T22:41:05.194536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:05.264882Z","title":"Rescaling egocentric vision: Collection, pipeline and chal- lenges for epic-kitchens-100","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:05.264882Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:fff3036c19ab44990b44122dbd754bfca79e8d7b7a401619da23efecd4a4355f","observation_id":"83186980-8b3a-4933-87b6-8c95b18c8fe3","resolution":{"observed_at":"2026-08-06T22:41:05.264882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:05.336235Z","title":"Asd-transformer: 9 Efficient active speaker detection using self and multimodal transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:05.336235Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:a2b0d2484c88b9463a11eed60a8aed325fe30fe75e0e64bedfb931659d291428","observation_id":"90aaed7c-cac0-40f2-9775-39db5758f92a","resolution":{"observed_at":"2026-08-06T22:41:05.336235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:05.371397Z","title":"Episodic memory question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:05.371397Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:0a099d1575ee1dad9b9e0542e107c9ca6c8d5e412bc7bf75192a35df8441fb19","observation_id":"260df751-ea28-42bd-9585-170cf215229e","resolution":{"observed_at":"2026-08-06T22:41:05.371397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:05.446747Z","title":"Forecast- ing action through contact representations from first person video","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:05.446747Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:fc15fca56167adadeaf6e68cc3af450aa5b56f1a2e75daec326b6c2d3c1a2976","observation_id":"ec91151a-5395-4164-944f-6fad809c077d","resolution":{"observed_at":"2026-08-06T22:41:05.446747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.04174","last_updated":"2021-10-18T22:37:53Z","snapshot_observed_at":"2026-07-06T11:27:31.181558Z","submitted_at":"2021-07-09T02:00:47Z","title":"EasyCom: An Augmented Reality Dataset to Support Algorithms for Easy Communication in Noisy Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.04174","snapshot_observed_at":"2026-08-06T22:41:05.522000Z","title":"Easycom: An augmented re- ality dataset to support algorithms for easy communication in noisy environments","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:05.522000Z"},"links":{"cited_paper":"/paper/2107.04174","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:14e3cb60bcc4e84560ada54d1fcb72097b5accb0c3b575e116f161848909722d","observation_id":"bb167565-1780-4e69-9737-ee8af7983645","resolution":{"observed_at":"2026-08-06T22:41:05.522000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11487","last_updated":"2024-04-02T04:27:55Z","snapshot_observed_at":"2026-07-06T17:46:04.063798Z","submitted_at":"2024-03-18T05:38:07Z","title":"Can LLMs Generate Human-Like Wayfinding Instructions? Towards Platform-Agnostic Embodied Instruction Synthesis","version":3},"cited_work":{"arxiv_id":"2403.11487","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.11487","snapshot_observed_at":"2026-08-06T22:41:14.872216Z","title":"Can LLMs Generate Human-Like Wayfinding Instructions? Towards Platform-Agnostic Embodied Instruction Synthesis","venue":"cs.RO","work_id":"3650a009-d479-415f-a66c-124a22f6c593","year":2024},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:05.588216Z"},"links":{"cited_paper":"/paper/2403.11487","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:1e2ff878eddf9688ebeca0a848ead8880599d9b08bccbacc357a7f73b612bcc0","observation_id":"7f100fc8-33e6-4798-b4f9-4e8062c1117e","resolution":{"observed_at":"2026-08-06T22:41:14.947383Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:05.650223Z","title":"Multiscale vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:05.650223Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:07388a08ee30d31b9d9847bcaf267d14799a876cfc141d1b6e77261f88ed5770","observation_id":"d1920f1d-8861-4629-8a9f-23ea35ee3944","resolution":{"observed_at":"2026-08-06T22:41:05.650223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:05.720006Z","title":"Modeling actions through state changes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:05.720006Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:d23552de5edd40bc412a68313126d1f804e0768539edb274d954fac4d41de3c2","observation_id":"0a2067df-c5a2-4baf-8cd7-fb4dcf37de57","resolution":{"observed_at":"2026-08-06T22:41:05.720006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:05.771188Z","title":"X3d: Expanding architectures for efficient video recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:05.771188Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:10e6c079fa950a7433fef7a71830ebb35aa92d73c7ad372b96625b9ac2969bc3","observation_id":"c3fe335f-e4e8-4759-b277-0171bf2bc626","resolution":{"observed_at":"2026-08-06T22:41:05.771188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:05.842764Z","title":"Spatially adaptive computation time for residual networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:05.842764Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:1e0d369caa24dd74f6a67baf92909b32910855e140e0e065a1d8917dca8fd8f3","observation_id":"b46500c3-fc94-4f80-be9b-69ab8c30904e","resolution":{"observed_at":"2026-08-06T22:41:05.842764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:05.918064Z","title":"Self-supervised moving vehicle tracking with stereo sound","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:05.918064Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:f2a5a6bcdcc050e86a958f1b6501c76491c78623a203fb2e773d29b173e117e6","observation_id":"962f0af1-1581-4b4e-8f15-c67ba56b61bc","resolution":{"observed_at":"2026-08-06T22:41:05.918064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:05.987649Z","title":"Audio–visual representation learning for anomaly events detection in crowds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:05.987649Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:96a8ec278f1ffc22740da119f3150bd2e012ede69b9d1d381fc1ea3f8c6c1711","observation_id":"58364293-91ca-4a26-9c1e-68c32a4e8a9b","resolution":{"observed_at":"2026-08-06T22:41:05.987649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:06.045398Z","title":"Dynamic zoom-in network for fast object detection in large images","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.045398Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:135944e3be389d0e7abcca80646e5cf6054867bc7bb482e822de386209a7557b","observation_id":"86d6baf7-2cae-4f86-8a53-ed963f27069c","resolution":{"observed_at":"2026-08-06T22:41:06.045398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:06.119935Z","title":"Listen to look: Action recognition by previewing audio","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.119935Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:b8cd021ea5bc4bef708cec63448dc315efd7a284e44164da6a3d711ac2793ccf","observation_id":"3726d1a6-c2fa-48c0-813d-62724854e5a9","resolution":{"observed_at":"2026-08-06T22:41:06.119935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:06.188834Z","title":"Modality distillation with multiple stream networks for ac- tion recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.188834Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:dc321208e4c7d132c31df0043e0abffd132c8f94ec6f56cf1d04deb6eca0b008","observation_id":"e1bee500-793a-4247-a5fe-ee80766a8cb4","resolution":{"observed_at":"2026-08-06T22:41:06.188834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:06.257349Z","title":"Gpytorch: Blackbox matrix-matrix gaussian process inference with gpu acceler- ation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.257349Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:8cd493431dc373169d83353ca38e9859ebb2e459b488376989f8b0a8096a2d26","observation_id":"868586c7-56c5-4e23-a4c6-e136a9ac7d4d","resolution":{"observed_at":"2026-08-06T22:41:06.257349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:06.314422Z","title":"Frameexit: Conditional early exiting for ef- ficient video recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.314422Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:9a039c9fb4ef3eef4336b909423dcb203223c5198e57cf797041f22f0823bc3d","observation_id":"12f17a3d-e296-4014-9ba9-44e13b825e9f","resolution":{"observed_at":"2026-08-06T22:41:06.314422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:06.370166Z","title":"Omni- vore: A single model for many visual modalities","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.370166Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:5949649362547a2f83d9d715aafc0b850cfee8a5b50cf3a60fad7f19cc903614","observation_id":"39397d87-ef69-41cb-913b-cb577364c524","resolution":{"observed_at":"2026-08-06T22:41:06.370166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:06.430024Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.430024Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:12c08257a85e88ac115743400e5d67be7f70974ea31787035cc84be002acf763","observation_id":"0e7fe8e4-db61-40fa-9ece-63c2ed76bf3a","resolution":{"observed_at":"2026-08-06T22:41:06.430024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:06.471069Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.471069Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:6f36ae17f6d4e17ba61391f345035114d58544d04ecfb147682713a1f560951c","observation_id":"fffbecb7-2130-49dd-8975-70086a6a0fd1","resolution":{"observed_at":"2026-08-06T22:41:06.471069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:06.530265Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.530265Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:dd348c1ba93453a60bdfaab52a528bd79ced414ddcfa1944223b1de29767cba7","observation_id":"12551065-b5c0-47db-8f3a-8535e5cb4ce3","resolution":{"observed_at":"2026-08-06T22:41:06.530265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.08983","last_updated":"2017-02-21T16:21:21Z","snapshot_observed_at":"2026-08-04T14:24:45.814840Z","submitted_at":"2016-03-29T22:09:00Z","title":"Adaptive Computation Time for Recurrent Neural Networks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.08983","snapshot_observed_at":"2026-08-06T22:41:06.630237Z","title":"Adaptive computation time for recurrent neu- ral networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.630237Z"},"links":{"cited_paper":"/paper/1603.08983","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:fd4df4e846ba65bb64aa89df0641e14f6adb6e7ae54ee3447a489552070fe3de","observation_id":"4ea3ddc5-1067-4ba3-b7e4-91525a078b14","resolution":{"observed_at":"2026-08-06T22:41:06.630237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:06.730120Z","title":"Spottune: transfer learning through adaptive fine-tuning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.730120Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:8e0fc07ff167282cf2f391911a4ff71be725b9b460682f57887bffae89301f3e","observation_id":"0b5bc4c8-b2e7-428f-8a71-c844ce2af82e","resolution":{"observed_at":"2026-08-06T22:41:06.730120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:06.813612Z","title":"Cross modal distillation for supervision transfer","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.813612Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:c687da4961fdb6d5c8a581ea5a63e5ff1aca7ceb338a886d0abce2747bf2b9b6","observation_id":"018c9fce-d3c2-4452-8c86-a07c0a581d43","resolution":{"observed_at":"2026-08-06T22:41:06.813612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:06.891268Z","title":"Rethinking imagenet pre-training","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.891268Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:8af55b80fe567f82dd4ef799954e978ac346ddf61660ab8f7142e799f492c800","observation_id":"ca98c188-ba91-43ff-b61b-2a15c04192a0","resolution":{"observed_at":"2026-08-06T22:41:06.891268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:06.983699Z","title":"Ronin: Robust neural inertial navigation in the wild: Bench- mark, evaluations, & new methods","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:06.983699Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:7a3f857bdf8e02a9f0863d57c6e884759d569dbc5d7fab24472c95b5e24ff161","observation_id":"88bcd877-1220-4cbe-a065-5a9147ffcce0","resolution":{"observed_at":"2026-08-06T22:41:06.983699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:07.068881Z","title":"Object-region video transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.068881Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:1f6552b9af135883cd70fab0e056112e5190ec263c9e7f9a367b9bfe34bfbc43","observation_id":"45e0a3c5-490a-4517-8e71-7bf4e6b5f75f","resolution":{"observed_at":"2026-08-06T22:41:07.068881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-06T22:41:07.258224Z","title":"Distill- ing the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.258224Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:82bbe06c02b68b0a049016b4007871da45c979b6712817674921097d01de9371","observation_id":"c1628c96-bc20-492c-ba48-a8f9ffa90778","resolution":{"observed_at":"2026-08-06T22:41:07.258224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:07.344783Z","title":"Channel gating neural net- works","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.344783Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:a79b4d5c391d0a320c98190cbbd924f56c0252abefc43ef172724420cccc0e69","observation_id":"3e3c0298-dc9f-4fc0-bffd-dd4142dab1c6","resolution":{"observed_at":"2026-08-06T22:41:07.344783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:07.422219Z","title":"Mutual context network for jointly estimating egocentric gaze and action","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.422219Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:048f7e40b9c5181a7407c1ce1a7b78757d9818b473390761bee41a7329ecdc95","observation_id":"cf6a160b-6734-48c5-a1a3-e722bb7c1abb","resolution":{"observed_at":"2026-08-06T22:41:07.422219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01144","last_updated":"2017-08-05T22:45:19Z","snapshot_observed_at":"2026-08-01T18:34:23.156273Z","submitted_at":"2016-11-03T19:48:08Z","title":"Categorical Reparameterization with Gumbel-Softmax","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01144","snapshot_observed_at":"2026-08-06T22:41:07.511665Z","title":"Categorical reparameterization with gumbel-softmax","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.511665Z"},"links":{"cited_paper":"/paper/1611.01144","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:75df71a796b83727fb131a0314ca910a1f03c5191998be7a3b7f5d3cfca7d92e","observation_id":"2a8abe7f-04fe-40e2-a30a-041291f45362","resolution":{"observed_at":"2026-08-06T22:41:07.511665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:07.563228Z","title":"The audio-visual conversational graph: From an egocentric-exocentric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.563228Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:85b2ba6f79a7503127b470ca49feaf31b85c7bc7ff0f33f4a2bf08f7bcd9db36","observation_id":"462f7fa1-5907-4521-9342-d8634aeb1862","resolution":{"observed_at":"2026-08-06T22:41:07.563228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:07.675228Z","title":"Egocentric deep multi-channel audio-visual active speaker localization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.675228Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:7553231e58ffc078a5a92415d3e864c3804231f0e660ce01fa8c1dac239edc36","observation_id":"e9e3759d-089e-4cea-95e0-dc6ac84c4c3d","resolution":{"observed_at":"2026-08-06T22:41:07.675228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:07.760447Z","title":"Multitask learning to im- prove egocentric action recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.760447Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:57cf87b82ad180665037a9092dc0986524f112b5e4d7bd8ef665ac50af6733c3","observation_id":"f3848904-24d1-42fc-ba47-627de17f289c","resolution":{"observed_at":"2026-08-06T22:41:07.760447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:07.859737Z","title":"Epic-fusion: Audio-visual temporal binding for egocentric action recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.859737Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:eaedccf0fed81f2d8857bf2ec4815aaf2d94e1faa10b50fb5e035613253df10f","observation_id":"1bf42d48-c3d2-4198-92c1-f25fb476efea","resolution":{"observed_at":"2026-08-06T22:41:07.859737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:07.942561Z","title":"Epic-fusion: Audio-visual temporal binding for egocentric action recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:07.942561Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:076d07e0f9538ba465993484f37726f8ae2cd5e6d368a83e271e95d522408b47","observation_id":"1450423f-9029-4d8e-a109-2acc8449fb52","resolution":{"observed_at":"2026-08-06T22:41:07.942561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:08.046444Z","title":"Motion guided attention fusion to recognize interactions from videos","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.046444Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:8eb13fb54ed6a433dac0e82c7e433f400550fa18289b100577efdb6e1364b3f3","observation_id":"0f1cf69e-19a4-41ad-9247-ec1fa0d6e402","resolution":{"observed_at":"2026-08-06T22:41:08.046444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:08.150351Z","title":"Movinets: Mobile video networks for efficient video recog- nition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.150351Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:dd13ce40e1f60eedee61171138b73a019cb3bbe3c417794504c93054558f2281","observation_id":"4810d50f-fe6c-408a-8ede-ce464c7f41f5","resolution":{"observed_at":"2026-08-06T22:41:08.150351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:08.251089Z","title":"Scsam- pler: Sampling salient clips from video for efficient action recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.251089Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:0d17e47d67eca07e9de92b49302b57cc78849c5f9cc658025b944f030f2963f7","observation_id":"fc2f8cc3-837d-49ac-8ac3-09657185bc78","resolution":{"observed_at":"2026-08-06T22:41:08.251089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04464","last_updated":"2024-10-16T00:47:58Z","snapshot_observed_at":"2026-08-05T14:11:58.816628Z","submitted_at":"2022-08-08T23:25:05Z","title":"In the Eye of Transformer: Global-Local Correlation for Egocentric Gaze Estimation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.04464","snapshot_observed_at":"2026-08-06T22:41:08.361759Z","title":"In the eye of transformer: Global-local correlation for egocentric gaze estimation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.361759Z"},"links":{"cited_paper":"/paper/2208.04464","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:851ed64f0ad4f2791f9cc74e54af1100707d8b26350702d0879e84bf4f1f36d7","observation_id":"147fdf64-251a-4bab-8f4a-34c9b1b46ecb","resolution":{"observed_at":"2026-08-06T22:41:08.361759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:08.453756Z","title":"Delving into ego- centric actions","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.453756Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:3aba4f7fba3921d22b6ef51f0233b79c32c282ed0f3ef533e8e39454bb70a19a","observation_id":"7322cbec-1589-49d7-bcf5-a9f51461ab09","resolution":{"observed_at":"2026-08-06T22:41:08.453756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:08.530085Z","title":"In the eye of the be- holder: Gaze and actions in first person video","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.530085Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:171f62970368714b72131720805c10433fadd36318a837ffd1e0ffda3056e59b","observation_id":"3a2c2dc9-b299-40a7-8d07-a879c856a754","resolution":{"observed_at":"2026-08-06T22:41:08.530085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:24.353242Z","title":"Egocentric pre- diction of action target in 3d","venue":null,"work_id":"c191443c-02f8-4c82-bdaa-b93aa69253f4","year":2022},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.602547Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:e079cf925fb65e98051c060ddb7ecf376eb4aa42b4610c6c856c59a1dd61712a","observation_id":"27930362-ae90-4004-9abb-ff25b7300fe3","resolution":{"observed_at":"2026-08-06T22:41:24.434352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:24.187791Z","title":"A light weight model for active speaker detection","venue":null,"work_id":"9e0dd74e-31be-4774-a0aa-4b65c3e16555","year":2023},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.705472Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:8e44d0f6842af923fe27082cd5309802c71e45a9ea9548bc905a3aadb4293391","observation_id":"ce000e87-9d6b-4164-a5f0-251f9356e0c1","resolution":{"observed_at":"2026-08-06T22:41:24.261752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:08.816110Z","title":"Joint hand motion and interaction hotspots prediction from egocentric videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.816110Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:fad28dafebc611ceedbefc402fb5b7edfbad510dc9a77b4106978be5cd8abf5d","observation_id":"5460b313-ed7f-4bc6-ad5f-23947a868a72","resolution":{"observed_at":"2026-08-06T22:41:08.816110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:24.011489Z","title":"Jointly recog- nizing object fluents and tasks in egocentric videos","venue":null,"work_id":"2e853a63-2308-4614-8c91-2f9b412dc5ce","year":2017},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:08.895010Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:d4139b9ddea6c6e5190d5bfac592bcf4da2edcf807bed31aa966628f94c8bef6","observation_id":"3a56acac-9ec2-473c-bb4f-39c96e3f3ed6","resolution":{"observed_at":"2026-08-06T22:41:24.097648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:23.864606Z","title":"3d-to-2d distillation for indoor scene parsing","venue":null,"work_id":"9351d42a-718f-4d8d-88fa-9d082c32cc2c","year":2021},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.001261Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:eb19a96f5f46f6ca442d191463101865e0fe7428c4b142c76f1097311f3565a7","observation_id":"847548ca-0b10-4c20-9405-0ff70588f4af","resolution":{"observed_at":"2026-08-06T22:41:23.947728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13349","last_updated":"2024-02-22T03:37:36Z","snapshot_observed_at":"2026-08-07T04:03:49.639867Z","submitted_at":"2024-02-20T19:53:15Z","title":"Aria Everyday Activities Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13349","snapshot_observed_at":"2026-08-06T22:41:09.122881Z","title":"Aria ev- eryday activities dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.122881Z"},"links":{"cited_paper":"/paper/2402.13349","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:726fad3b7cd2c3bc586186a7cae015c636a470e1f44d8dc5a92d00ca0501b1b3","observation_id":"caf47f8d-5e3c-4663-9aad-ce892382b706","resolution":{"observed_at":"2026-08-06T22:41:09.122881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:23.706737Z","title":"Something-else: Com- positional action recognition with spatial-temporal interac- tion networks","venue":null,"work_id":"e13dd3c9-b1c5-4bea-aac2-a14230d13ff9","year":2020},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.233163Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:2d6aca257577bfb8ff566f73e34cbe16fadc5a97181e2319f234907261c88abe","observation_id":"09189455-1e69-4e48-afae-84444398c3d1","resolution":{"observed_at":"2026-08-06T22:41:23.786347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:23.543463Z","title":"Deciding how to decide: Dynamic routing in artificial neural networks","venue":null,"work_id":"7f7cb214-d364-4bca-bbb4-3c9dee4b2e11","year":2017},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.319235Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:72d8c099f0490088d5e915f0165ddbce7305e9e1fd76498fd83751271bb73f74","observation_id":"27423065-8f70-451a-a82d-d4210b564b90","resolution":{"observed_at":"2026-08-06T22:41:23.625388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:23.344365Z","title":"Foleygen: Visually-guided audio generation","venue":null,"work_id":"48a6fbae-e30b-4c1f-9443-4abafc975f78","year":2024},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.394197Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:e16d58508b2309b098f72c5d08dc30c6bccad405a97abf4e53cf7fecedb5d345","observation_id":"46d04533-7032-4a22-803f-9ff17f8241f9","resolution":{"observed_at":"2026-08-06T22:41:23.439965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:23.151758Z","title":"Ar-net: Adaptive frame resolution for effi- cient action recognition","venue":null,"work_id":"5c6bb31a-d06a-4be9-9b22-b22c939ddb26","year":2020},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.479290Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:4fb966b07a914fdbb5e21f56c572c471ffa76ae515e37b146b74981ec118f7fa","observation_id":"2bdafe64-ccc5-40ba-a05a-96e772a178dc","resolution":{"observed_at":"2026-08-06T22:41:23.253551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05775","last_updated":"2021-02-10T23:31:02Z","snapshot_observed_at":"2026-08-05T13:00:17.343970Z","submitted_at":"2021-02-10T23:31:02Z","title":"AdaFuse: Adaptive Temporal Fusion Network for Efficient Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05775","snapshot_observed_at":"2026-08-06T22:41:09.568759Z","title":"Adafuse: Adaptive temporal fusion network for efficient action recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.568759Z"},"links":{"cited_paper":"/paper/2102.05775","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:395ff3489ec793abd301b1f2698a28c36da455615cc1bd41246785bd3bc69ff2","observation_id":"c689235e-9a8d-4287-8fd0-7428aac40b35","resolution":{"observed_at":"2026-08-06T22:41:09.568759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:22.962345Z","title":"Integrating human gaze into attention for egocentric activity recognition","venue":null,"work_id":"609fb471-2f55-444c-a70d-d7c8e454034b","year":2021},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.664522Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:cb6bb3f9a069242ff4a94925d6d21b0d49df209fa079b4a4df67bd2f35a8d8c4","observation_id":"29e14c56-5065-4899-9a8b-b403f3fe0be5","resolution":{"observed_at":"2026-08-06T22:41:23.071863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:22.793655Z","title":"Towards determining per- ceived audience intent for multimodal social media posts using the theory of reasoned action","venue":null,"work_id":"f3373470-3529-47c4-8968-224a7a1d1611","year":2024},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.773548Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:80323939ada92f3360751d2e9a8ca3ea4bb3e35dac218b8fb434261792ffac8a","observation_id":"fbbc402f-3bdf-47e4-929b-4f1f3524a935","resolution":{"observed_at":"2026-08-06T22:41:22.858559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:22.606732Z","title":"Safari: Adaptive sequence transformer for weakly super- vised referring expression segmentation","venue":null,"work_id":"4bb92e64-52d3-488d-a8b9-2e301ae43bd2","year":null},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.863434Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:1d9168d8a6c3b4f5605245e9b17aed9719e5ff0e10e734e5ac592489fdd54f14","observation_id":"d520855f-c3fa-4657-9674-196b0f388b19","resolution":{"observed_at":"2026-08-06T22:41:22.695942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:22.439533Z","title":"Attention bottlenecks for multimodal fusion","venue":null,"work_id":"dd6084b1-0c14-410b-b464-7e8508cfd649","year":2021},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:09.950255Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:d6152dcc8e8f4ae9a6b6ae0a2d9438b5bab6f14e3dd036d0458fe6f6350bbb64","observation_id":"b990a76c-e343-4d8e-ac95-1732a1ebdb20","resolution":{"observed_at":"2026-08-06T22:41:22.531762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:22.126628Z","title":"Auto- focus: Efficient multi-scale inference","venue":null,"work_id":"762f346e-6ec4-4405-8364-b8d5bdb68688","year":2019},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.079475Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:8f6dc75ae8a611b4cde68ac11ac693e071d1df1e129e5897f3146247abbf4e83","observation_id":"0689cc12-8876-4251-8c7a-8490bb9ae143","resolution":{"observed_at":"2026-08-06T22:41:22.292493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:21.813963Z","title":"Adamml: Adaptive multi-modal learning for efficient video recognition","venue":null,"work_id":"5abf21c9-7b02-49f9-8f85-b706dfd2fab0","year":2021},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.206179Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:0efede22924cd1cddac316af6927105456fa7204b7f53945bd203c6f0c315f9d","observation_id":"29558408-4d76-4c11-98e0-ccd5722b8b7b","resolution":{"observed_at":"2026-08-06T22:41:21.937283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:21.593554Z","title":"Per-clip video object seg- mentation","venue":null,"work_id":"748b5659-684e-438e-9414-bb6983b4918e","year":2022},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.316368Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:82b9fecdfa25551704887c4de64c45b9c5d1d1b83c319336e08c425c1b453cd3","observation_id":"a5bde000-8c8f-4ae3-afec-42de59f3a6d1","resolution":{"observed_at":"2026-08-06T22:41:21.715402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:10.446372Z","title":"Relational knowledge distillation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.446372Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:df75289b6dbca8c6b6a3b9c1d6e1188405e763d9dae2f07ac02be1cc5c2e52ba","observation_id":"e4b00132-6b95-4e8e-9f7e-f4a3fb60c375","resolution":{"observed_at":"2026-08-06T22:41:10.446372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:21.260424Z","title":"Perception test: A diagnostic benchmark for multimodal video models","venue":null,"work_id":"155992b6-01cf-4844-9f6e-6fb342758edf","year":2024},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.541917Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:64cd658e1ae382d1bb5d5b0e1e443410c77c1a4d3ebf234b51d930e5665030d7","observation_id":"05780679-e840-4bfa-a021-0c0ced12ceeb","resolution":{"observed_at":"2026-08-06T22:41:21.411248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:20.983093Z","title":"Keeping your eye on the ball: Trajectory attention in video transformers","venue":null,"work_id":"e64c969e-0393-4e28-b7b1-85240e0c0d47","year":2021},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.671373Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:5c86a49f2cbce2381e06c5320bd4c69001725ea7a9ec3d12f56e707e082c32a8","observation_id":"418aaec9-d51b-4d58-bd1f-5d6f7257e922","resolution":{"observed_at":"2026-08-06T22:41:21.088261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:20.826724Z","title":"Clipping: Distilling clip-based models with a student base for video- language retrieval","venue":null,"work_id":"fb88ffe1-9bbb-479d-ac4d-bf2f9c3a35b6","year":2023},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.768817Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:8489ddeebca11e76804a98c90b83d84d29031e3d897d7ce5485289fda35a79e4","observation_id":"286d79ec-2cf7-427e-9e06-7247e19f9626","resolution":{"observed_at":"2026-08-06T22:41:20.876556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:20.713265Z","title":"E2 (go) motion: Motion augmented event stream for egocentric action recognition","venue":null,"work_id":"2b243321-20c0-43b7-9412-9f48ae27cf79","year":2022},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:10.937440Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:ca0fd0958dbea65ed46d2e84c202c4dbdd76f944ff8c78c14ad029877630cb44","observation_id":"43a4f148-2b6f-4bb8-9cad-f66f2db81317","resolution":{"observed_at":"2026-08-06T22:41:20.782618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12423","last_updated":"2024-06-19T22:20:40Z","snapshot_observed_at":"2026-07-06T17:05:27.005904Z","submitted_at":"2023-12-19T18:53:01Z","title":"Jack of All Tasks, Master of Many: Designing General-purpose Coarse-to-Fine Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12423","snapshot_observed_at":"2026-08-06T22:41:11.061406Z","title":"Jack of all tasks, master of many: Designing general-purpose coarse-to-fine vision- language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.061406Z"},"links":{"cited_paper":"/paper/2312.12423","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:e5d31bb5a6a51c5e6b8e3bb2d504304a99a7e13df1c5fe74b7ac2a0e22d3cbba","observation_id":"6226041d-62b7-4d13-82ff-75218f735c81","resolution":{"observed_at":"2026-08-06T22:41:11.061406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:20.598131Z","title":"V olta: Vision-language transformer with weakly-supervised local- feature alignment","venue":null,"work_id":"529a2ebc-53ec-4bc8-aab5-bc7b705aa945","year":2023},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.175734Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:0852b0ec696b5b2df350eaf6736866d33c298738ede4acd9e0ced494361589b9","observation_id":"7181400a-c6bb-43db-97a9-064e1b11b21c","resolution":{"observed_at":"2026-08-06T22:41:20.629071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:20.429804Z","title":"Egovlpv2: Egocentric video-language pre-training with fusion in the backbone","venue":null,"work_id":"b7ebc4cf-af23-4726-a001-a4beec170b49","year":2023},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.278359Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:a026f84c8cc90a1a42d21bf2a8024dc558c8b8bbfcff583bef9f48421b3b034e","observation_id":"657d326b-10da-4784-96ff-862d2a6858a2","resolution":{"observed_at":"2026-08-06T22:41:20.500866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:20.271575Z","title":"V-desirr: Very fast deep embedded single image reflection removal","venue":null,"work_id":"1906293e-d414-41cc-b3cd-a349907470f2","year":2021},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.368056Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:f635d230a746292e66b53371debd9a3e3e0cea9c42df16e665cbc0480e786ccc","observation_id":"e9e1fb3d-83ea-4576-ab93-e7db4b51ed94","resolution":{"observed_at":"2026-08-06T22:41:20.367900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.01936","last_updated":"2021-11-02T23:04:39Z","snapshot_observed_at":"2026-07-06T12:04:50.543813Z","submitted_at":"2021-11-02T23:04:39Z","title":"Revisiting spatio-temporal layouts for compositional action recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.01936","snapshot_observed_at":"2026-08-06T22:41:11.472865Z","title":"Revisiting spatio-temporal layouts for compositional action recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.472865Z"},"links":{"cited_paper":"/paper/2111.01936","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:81586a96dfc0b600c41f8e039d8d4a1d2971ff37b70757ab947dfbb35ccf7f35","observation_id":"7920132a-c90d-4e42-a62f-fb7377043752","resolution":{"observed_at":"2026-08-06T22:41:11.472865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:20.208400Z","title":"Multimodal distillation for egocentric action recognition","venue":null,"work_id":"4600d6f6-f3e2-43df-9c81-cb5015852eef","year":2023},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.560534Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:001a0056929df344e3ec1d7c791c09042f47d9e8c920b3a698072ca0758586ae","observation_id":"f6cb591f-c270-4121-98f9-3c8fb7417e48","resolution":{"observed_at":"2026-08-06T22:41:20.242738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:20.047519Z","title":"Faster r-cnn: Towards real-time object detection with re- gion proposal networks.IEEE transactions on pattern anal- ysis and machine intelligence, 39(6):1137–1149, 2016","venue":null,"work_id":"2ccc7d75-9928-4e3d-9fb5-a5bd65c211b1","year":2016},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.644202Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:c8507d54e1828050fd00fb674914aff426a9fd75edbde544e29dc4a316bdbad5","observation_id":"047f1deb-ec97-462b-8c4a-437e1b5d5e93","resolution":{"observed_at":"2026-08-06T22:41:20.132539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:19.935544Z","title":"Channel-wise knowledge distillation for dense prediction","venue":null,"work_id":"855bfde6-1ccd-420e-b066-e1fb36137b01","year":null},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.646898Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:de5bfad314cbb7d5ecea63417cf2ea259b80645d150ad9c23a3b5fec6bd9e731","observation_id":"a31e1115-48f1-4f91-8921-685f9032b198","resolution":{"observed_at":"2026-08-06T22:41:19.999514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.09626","last_updated":"2018-04-30T16:57:00Z","snapshot_observed_at":"2026-08-07T16:08:52.487917Z","submitted_at":"2018-04-25T15:30:27Z","title":"Charades-Ego: A Large-Scale Dataset of Paired Third and First Person Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.09626","snapshot_observed_at":"2026-08-06T22:41:11.659528Z","title":"Charades-ego: A large- scale dataset of paired third and first person videos","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.659528Z"},"links":{"cited_paper":"/paper/1804.09626","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:07a984269039eff14aa46d43d85435f97620804643e022ef00a853b5bc2b8cdd","observation_id":"9b1a523b-f0fa-4514-ac01-8c941f73eff2","resolution":{"observed_at":"2026-08-06T22:41:11.659528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14562","last_updated":"2025-05-20T16:21:27Z","snapshot_observed_at":"2026-08-07T15:29:54.484624Z","submitted_at":"2025-05-20T16:21:27Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","version":1},"cited_work":{"arxiv_id":"2505.14562","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.14562","snapshot_observed_at":"2026-08-06T22:41:14.663492Z","title":"Representation Learning for Semantic Alignment of Language, Audio, and Visual Modalities","venue":"cs.SD","work_id":"62c94015-01e2-4e1f-a6fd-35808f87e957","year":2025},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.839628Z"},"links":{"cited_paper":"/paper/2505.14562","citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:4449589d2b829c6a1a771eb2de0945e90e3cec3dde14ce617ce1d7f7e29b75ad","observation_id":"3301051a-947f-4ff9-90c4-2bd38cb9021d","resolution":{"observed_at":"2026-08-06T22:41:14.716289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:19.802662Z","title":"How to evaluate deep neural network processors: Tops/w (alone) considered harmful","venue":null,"work_id":"13bb2daf-2855-47e0-a30e-f7f96797b686","year":2020},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:11.966567Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:7f5e4e862f217fa214f872d2b8b28cb4be1f48f0a1f5771644c6483d2901544f","observation_id":"f4f6156a-c833-4352-adfc-1f9eaf2fe91a","resolution":{"observed_at":"2026-08-06T22:41:19.851809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:19.691182Z","title":"Egodistill: Egocentric head motion distillation for efficient video understanding","venue":null,"work_id":"ea416a13-7d47-46dd-bf31-1a0ab4933bd6","year":2023},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:12.117518Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:470142fedec2a1d29683818451cbec1b8231ce006a0f04b213c8773984044b53","observation_id":"1590007f-7d13-4edc-abdf-795cf2878508","resolution":{"observed_at":"2026-08-06T22:41:19.733174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:19.572415Z","title":"Codi-2: In-context interleaved and interactive any-to-any generation","venue":null,"work_id":"c45c0e37-cb2f-4ee0-8de1-ef4172bb664b","year":2024},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:12.231266Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:aa61dc934495db94a8da628b30b7c1c4d4efb99637e8511d9881795ba3d916be","observation_id":"da85e8f5-5f13-48a0-bc0f-0d0f2224278a","resolution":{"observed_at":"2026-08-06T22:41:19.651175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:19.458601Z","title":"Is someone speaking? exploring long-term temporal features for audio-visual ac- tive speaker detection","venue":null,"work_id":"7020a547-2d03-4a99-897e-535ab8d6d9db","year":null},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:12.312955Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:1dd204755f735081c8dece73210cf1a21bdb8ae0cca29ec5401aa8c9e08a4737","observation_id":"5694e17c-2fbc-433a-959f-1409ed3a37a1","resolution":{"observed_at":"2026-08-06T22:41:19.492756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:41:19.302254Z","title":"H+ o: Unified egocentric recognition of 3d hand-object poses and interactions","venue":null,"work_id":"7dae4733-0adb-43cc-b557-12add448bdd7","year":2019},"citing_paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T22:41:12.402302Z"},"links":{"citing_paper":"/paper/2506.21080"},"observation_digest":"sha256:4b7c63c411eaffad543153b78107c858eea9ee714bcdc8b6ef5ff91718b10c9a","observation_id":"a31833ad-97cc-4edf-8e64-0eca3d5eb392","resolution":{"observed_at":"2026-08-06T22:41:19.366596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.21080","last_updated":"2025-06-26T08:09:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T17:47:39.726590Z","submitted_at":"2025-06-26T08:09:16Z","title":"EgoAdapt: Adaptive Multisensory Distillation and Policy Learning for Efficient Egocentric Perception"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":67,"verified_exact":3,"verified_fuzzy":30},"total_outbound_references":130},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 130 outbound references and 1 inbound Pith citation observation for arXiv:2506.21080."}