{"as_of":"2026-08-08T03:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:196e14b4477d2a9ca330b89dc5bd0f7eccfef19b9fba364fd1e139725b750ae1","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:26:24.845540Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:37:18.332035Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:26:17.693248Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15833","snapshot_observed_at":"2026-08-03T04:37:18.332035Z","title":"Look, focus, act: Efficient and robust robot learning via human gaze and foveated vision transform- ers.arXiv preprint arXiv:2507.15833, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.04600","last_updated":"2026-07-10T13:11:24Z","snapshot_observed_at":"2026-08-06T22:16:31.922188Z","submitted_at":"2026-02-04T14:28:14Z","title":"Act, Sense, Act: Learning Active Perception from Large-Scale Egocentric Human Data","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:18.332035Z"},"links":{"cited_paper":"/paper/2507.15833","citing_paper":"/paper/2602.04600"},"observation_digest":"sha256:f6d0b6374516c21e3d4cc0034c808688da67dacca58af7f479d5817b35d75222","observation_id":"400d48b8-c366-4ddf-b290-5bc82097a836","resolution":{"observed_at":"2026-08-03T04:37:18.332035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"cited_work":{"arxiv_id":"2507.15833","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15833","snapshot_observed_at":"2026-07-15T01:20:46.955469Z","title":"Look, focus, act: Efficient and robust robot learning via human gaze and foveated vision transform- ers","venue":null,"work_id":"d707f479-e8ad-4af4-8eb5-f862033cf504","year":2025},"citing_paper":{"arxiv_id":"2603.03243","last_updated":"2026-05-14T23:12:06Z","snapshot_observed_at":"2026-08-01T20:30:21.157166Z","submitted_at":"2026-03-03T18:36:49Z","title":"HoMMI: Learning Whole-Body Mobile Manipulation from Human Demonstrations","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T11:30:47.668896Z"},"links":{"cited_paper":"/paper/2507.15833","citing_paper":"/paper/2603.03243"},"observation_digest":"sha256:2a0a8ba357cb2e4e9d15ce260d56e07bc1f8fee09d21db98059a9cd38ec2005c","observation_id":"faa22e20-d41f-4fc6-8fbb-7668f984ac9f","resolution":{"observed_at":"2026-07-15T01:20:46.955469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"cited_work":{"arxiv_id":"2507.15833","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15833","snapshot_observed_at":"2026-07-15T01:20:46.955469Z","title":"Look, focus, act: Efficient and robust robot learning via human gaze and foveated vision transform- ers","venue":null,"work_id":"d707f479-e8ad-4af4-8eb5-f862033cf504","year":2025},"citing_paper":{"arxiv_id":"2604.04439","last_updated":"2026-06-02T14:54:06Z","snapshot_observed_at":"2026-07-13T09:50:41.912206Z","submitted_at":"2026-04-06T05:39:29Z","title":"Estimating Central, Peripheral, and Temporal Visual Contributions to Human Decision Making in Atari Games","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T19:26:50.491037Z"},"links":{"cited_paper":"/paper/2507.15833","citing_paper":"/paper/2604.04439"},"observation_digest":"sha256:6483cb0e3b7a5cfd0af5fbc9eab46249dc7b22ad836356832a7d2724ff249e98","observation_id":"2418b343-508b-4533-b05e-0840b352c181","resolution":{"observed_at":"2026-07-15T01:20:46.955469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"cited_work":{"arxiv_id":"2507.15833","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15833","snapshot_observed_at":"2026-07-15T01:20:46.955469Z","title":"Look, focus, act: Efficient and robust robot learning via human gaze and foveated vision transform- ers","venue":null,"work_id":"d707f479-e8ad-4af4-8eb5-f862033cf504","year":2025},"citing_paper":{"arxiv_id":"2604.22615","last_updated":"2026-04-30T12:27:46Z","snapshot_observed_at":"2026-08-06T16:33:11.467195Z","submitted_at":"2026-04-24T14:46:03Z","title":"GazeVLA: Learning Human Intention for Robotic Manipulation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T11:37:30.784513Z"},"links":{"cited_paper":"/paper/2507.15833","citing_paper":"/paper/2604.22615"},"observation_digest":"sha256:57999960ee153f74280393d2403dafab3451a23df56e268adde2b4120912422e","observation_id":"c2fdc816-f159-4253-8e4d-045e05a1d8b8","resolution":{"observed_at":"2026-07-15T01:20:46.955469Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"cited_work":{"arxiv_id":"2507.15833","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15833","snapshot_observed_at":"2026-07-15T01:20:46.955469Z","title":"Look, focus, act: Efficient and robust robot learning via human gaze and foveated vision transform- ers","venue":null,"work_id":"d707f479-e8ad-4af4-8eb5-f862033cf504","year":2025},"citing_paper":{"arxiv_id":"2606.02565","last_updated":"2026-06-01T17:55:05Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:55:05Z","title":"Policy-based Foveated Imaging and Perception","version":1},"reference_index":179,"source":"arxiv_source","source_observed_at":"2026-06-28T15:23:48.688620Z"},"links":{"cited_paper":"/paper/2507.15833","citing_paper":"/paper/2606.02565"},"observation_digest":"sha256:3e54dd7aff24bf182f53cc81cc24ea339f347032f93ccf5a2e701a7838bdd84b","observation_id":"8931d48f-eab7-4ddb-b650-a5167fc2ec83","resolution":{"observed_at":"2026-07-15T01:20:46.955469Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.15833/citation-record","integrity":"/paper/2507.15833/integrity","json":"/paper/2507.15833/citation-record.json","paper":"/paper/2507.15833"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-06T15:26:24.700155Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.700155Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:c915db8932cacd701eca0af580a3488cfe5eed1da2063b19977b08527720539e","observation_id":"ce980063-9b2b-461b-838a-d2ef1010ad05","resolution":{"observed_at":"2026-08-06T15:26:24.700155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13126","last_updated":"2024-10-17T01:29:49Z","snapshot_observed_at":"2026-08-05T13:44:48.719708Z","submitted_at":"2024-10-17T01:29:49Z","title":"ALOHA Unleashed: A Simple Recipe for Robot Dexterity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13126","snapshot_observed_at":"2026-08-06T15:26:24.704197Z","title":"Aloha unleashed: A simple recipe for robot dexterity,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.704197Z"},"links":{"cited_paper":"/paper/2410.13126","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:43c5cd11cc6e50f1e61e67fdd2fdc235111fe5df578ce16f28cbb4c068f9bd82","observation_id":"8d036f2d-56b9-4d0f-a3c2-c84d3e005baa","resolution":{"observed_at":"2026-08-06T15:26:24.704197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07914","last_updated":"2024-10-16T08:52:42Z","snapshot_observed_at":"2026-07-06T19:14:12.404382Z","submitted_at":"2024-09-12T10:30:44Z","title":"InterACT: Inter-dependency Aware Action Chunking with Hierarchical Attention Transformers for Bimanual Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07914","snapshot_observed_at":"2026-08-06T15:26:24.707646Z","title":"Interact: Inter- dependency aware action chunking with hierarchical attention trans- formers for bimanual manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.707646Z"},"links":{"cited_paper":"/paper/2409.07914","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:967e2918333207c02a260cfd12a65fbc8911a9cda1d88402212d33e17466b1f9","observation_id":"ac3e2aa1-72c6-4dce-af6e-7e9098bc9efd","resolution":{"observed_at":"2026-08-06T15:26:24.707646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.711214Z","title":"Vita: Vision-to-action flow matching policy,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.711214Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:9af47cc613fac6ff0b2793aff3355dcd416b7df14d66315fdc8b1672b0860f3d","observation_id":"8017729d-db14-493f-a309-65fcb4b4572b","resolution":{"observed_at":"2026-08-06T15:26:24.711214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10803","last_updated":"2025-09-09T09:24:29Z","snapshot_observed_at":"2026-08-05T12:04:21.579432Z","submitted_at":"2024-10-14T17:59:00Z","title":"Generalizable Humanoid Manipulation with 3D Diffusion Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10803","snapshot_observed_at":"2026-08-06T15:26:24.714604Z","title":"Generalizable humanoid manipulation with improved 3d diffusion policies,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.714604Z"},"links":{"cited_paper":"/paper/2410.10803","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:d6eff74b92d7b9cba20c199ae071f0bd4a67901e1ddb1b016dca223a849af330","observation_id":"4ef3337a-8f3a-4766-8946-6f089d06e628","resolution":{"observed_at":"2026-08-06T15:26:24.714604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.610764Z","title":"Flow matching imitation learning for multi-support manipulation,","venue":null,"work_id":"b12f87c3-4d4e-4b76-8fc6-a7b26904c7c9","year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.717772Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:c067469317798f7c4cc049b59a83dd90de03974e0f20cdf74ae4084dff5c7285","observation_id":"be4fd690-f188-45c2-ad0f-80bce9964087","resolution":{"observed_at":"2026-08-06T15:26:25.614565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21229","last_updated":"2025-03-06T07:50:56Z","snapshot_observed_at":"2026-08-07T04:45:06.794433Z","submitted_at":"2024-10-28T17:15:24Z","title":"HOVER: Versatile Neural Whole-Body Controller for Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21229","snapshot_observed_at":"2026-08-06T15:26:24.721012Z","title":"Hover: Versatile neural whole-body controller for humanoid robots,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.721012Z"},"links":{"cited_paper":"/paper/2410.21229","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:588bad4936e705a770f7ede096caccde1956c2e8c916d4ecd615daec4d23321f","observation_id":"9d405417-9ffc-45f0-9c01-85dd22b99060","resolution":{"observed_at":"2026-08-06T15:26:24.721012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.724047Z","title":"Diffusion policy: Visuomotor policy learning via ac- tion diffusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.724047Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:cb998b3d18b200ce44977396e16a1cd2cfa69981b66e53487295f4c9c0f1c7d8","observation_id":"7b63a1f5-d7fc-4df5-8bdf-4adad98b9637","resolution":{"observed_at":"2026-08-06T15:26:24.724047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.592508Z","title":"The foveal confluence in human visual cortex,","venue":null,"work_id":"fd07fb27-e6ab-4ef6-a153-cc962cbd8b30","year":2009},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.727042Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:9ef5f6022217e687293f3071afbb04b13eb7322e8f33a0027c745b8b5453cb60","observation_id":"38b966fb-cf15-464d-af2d-ef33f778f2a0","resolution":{"observed_at":"2026-08-06T15:26:25.597089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.582193Z","title":"Embedded foveation image coding,","venue":null,"work_id":"7e337d39-3d93-433c-8fb1-33efa515b880","year":2001},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.729740Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:a1506bc7914d619685ac169ea1be049c1c7bbdd37c60beaefa71d52e0aa259dc","observation_id":"a00962be-6c6e-4613-9abd-f1b73dba7680","resolution":{"observed_at":"2026-08-06T15:26:25.585592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1371/journal.pcbi.1005743","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.875178Z","title":"Object detection through search with a foveated visual system,","venue":null,"work_id":"75158c62-ab5f-4af8-94b1-fbbd2cd7de5e","year":2017},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.732580Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:e33fc381840ae4547ffe33933bf657676d4eeb78265431c49d95143bb4b0b6b2","observation_id":"3cf9e613-3c93-448c-a293-fcc2cae307f0","resolution":{"observed_at":"2026-08-06T15:26:24.880287Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17435","last_updated":"2025-03-08T01:43:40Z","snapshot_observed_at":"2026-08-04T01:39:32.450725Z","submitted_at":"2024-09-26T00:05:36Z","title":"Active Vision Might Be All You Need: Exploring Active Vision in Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17435","snapshot_observed_at":"2026-08-06T15:26:24.735889Z","title":"Active vision might be all you need: Exploring active vision in bimanual robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.735889Z"},"links":{"cited_paper":"/paper/2409.17435","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:071fd83920a8ea6474db4346e0dff75e77859fb0c771765e4532744cfe444834","observation_id":"a434271e-8c86-4fdc-8ea3-b511b3c1fc0c","resolution":{"observed_at":"2026-08-06T15:26:24.735889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01512","last_updated":"2024-07-08T16:59:38Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-07-01T17:55:35Z","title":"Open-TeleVision: Teleoperation with Immersive Active Visual Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01512","snapshot_observed_at":"2026-08-06T15:26:24.739499Z","title":"Open-television: Teleoperation with immersive active visual feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.739499Z"},"links":{"cited_paper":"/paper/2407.01512","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:5425e7ceb0c5a3e51436c2d5c32174bc9b413516786dbe7bfd0dd52e654da6c5","observation_id":"7c8085e4-1413-4275-9c96-7767ec56c83f","resolution":{"observed_at":"2026-08-06T15:26:24.739499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T15:26:24.742657Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.742657Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:a5a616addf9277d2cce3952515180463b87f7a552d2209190892d24401284cbd","observation_id":"2625bef8-c72f-4b74-b1f6-4bb7ede446be","resolution":{"observed_at":"2026-08-06T15:26:24.742657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T15:26:24.745877Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.745877Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:320cb7ae0b508ba79d6fe4497477c10643188a0b9f7901069568761a13e963be","observation_id":"27dd0c2d-8413-437c-af29-e4eefe655da4","resolution":{"observed_at":"2026-08-06T15:26:24.745877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18647","last_updated":"2026-06-26T02:30:53Z","snapshot_observed_at":"2026-07-06T19:39:01.657517Z","submitted_at":"2024-10-24T11:19:30Z","title":"Data Scaling Laws in Imitation Learning for Robotic Manipulation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18647","snapshot_observed_at":"2026-08-06T15:26:24.749095Z","title":"Data scaling laws in imitation learning for robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.749095Z"},"links":{"cited_paper":"/paper/2410.18647","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:18c4e4ee487f815bb880fadfe59dc9dc1ade2c53d3117d19a622d07056f9f33e","observation_id":"7bcea48b-5d35-4a42-8f3e-845284cd1aed","resolution":{"observed_at":"2026-08-06T15:26:24.749095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14974","last_updated":"2024-12-06T11:39:35Z","snapshot_observed_at":"2026-07-06T19:36:19.567469Z","submitted_at":"2024-10-19T04:37:01Z","title":"CAGE: Causal Attention Enables Data-Efficient Generalizable Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14974","snapshot_observed_at":"2026-08-06T15:26:24.752532Z","title":"Cage: Causal attention en- ables data-efficient generalizable robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.752532Z"},"links":{"cited_paper":"/paper/2410.14974","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:398e358f70eff7eb437549de0121cc56b3f2c1adfbb8c5dc1811aade3cebab27","observation_id":"f14a265d-03eb-4514-bb7d-7197b5033bbc","resolution":{"observed_at":"2026-08-06T15:26:24.752532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.571102Z","title":"Segment this thing: Foveated tok- enization for efficient point-prompted segmentation,","venue":null,"work_id":"eb559f78-824a-4b40-9d08-831fe3dd17da","year":2025},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.755787Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:fb0886671908ccb156ad93d48d01c8265bc44d57917662e7ef197889399ab151","observation_id":"88fd0ff6-82b8-463e-91c8-1287cee38fa0","resolution":{"observed_at":"2026-08-06T15:26:25.574949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.558439Z","title":"Non-extensive distribution of human eye photoreceptors,","venue":null,"work_id":"911a1645-67bc-4d63-902c-95cf8028c711","year":2017},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.759024Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:d35b4083221717750d35a528c8b8637e654d20551d87ed3eb7817d8ac81f496b","observation_id":"5aca11cf-b514-43f6-9e04-287915fc0983","resolution":{"observed_at":"2026-08-06T15:26:25.563037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.762941Z","title":"Marr,Vision: A computational investigation into the human repre- sentation and processing of visual information","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.762941Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:5bb695ae675724e1140a781da823d8c984b1b6f579823b547293c2b352ae7d64","observation_id":"ad4aa7f2-ebb3-49c5-9666-77ede44a1721","resolution":{"observed_at":"2026-08-06T15:26:24.762941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.540667Z","title":"Recognition-by-components: a theory of human image understanding","venue":null,"work_id":"486b3096-6988-4539-bfde-82a14d1faf60","year":1987},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.766260Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:0f28bbbb2ef59148999d2a495e5855e51ab080a3fa11553464423a8fed54c48b","observation_id":"916aa16d-60e9-4fe8-aebd-b97c28eeae05","resolution":{"observed_at":"2026-08-06T15:26:25.544217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.529776Z","title":"Neural mechanisms of selective visual attention,","venue":null,"work_id":"2ec1397f-3f7b-4be9-84c6-cc6c325d5dea","year":1995},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.769210Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:2028edf6b3dbb12e591d37fab808d9e95a5e63f6321c830f2fb3d52efc3328b6","observation_id":"9fcb47e2-20db-4f1d-9282-afb2d5973d9d","resolution":{"observed_at":"2026-08-06T15:26:25.533996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.519303Z","title":"How does the brain solve visual object recognition?","venue":null,"work_id":"f0619e61-d447-4269-a329-31c638de93f9","year":2012},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.772234Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:ec3eba66a718d00e974d12b90b488c7ea73e3f6635dc1d19911212b2e0e5849b","observation_id":"c218dcc9-e614-44e8-88ed-5fedcde6beda","resolution":{"observed_at":"2026-08-06T15:26:25.522885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.507019Z","title":"Performance-optimized hierarchical models predict neural responses in higher visual cortex,","venue":null,"work_id":"8c0b945a-3664-4942-968f-ff78c3cdca6b","year":2014},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.775393Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:ce5a234b0bad4178ab9347e4b9b866fb64092caa1bfeb4d6819bb366b4063bfe","observation_id":"669436bb-8971-43f8-9dda-8ad4d82dd3a0","resolution":{"observed_at":"2026-08-06T15:26:25.511051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.494755Z","title":"Context mitigates crowding: Peripheral object recognition in real-world images,","venue":null,"work_id":"11f0bad2-e90d-4887-9ff2-5cc9b778dd3a","year":2018},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.778460Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:da285e3cc356c17c8649e460bfb61c2ae44770630e45ffa797ce067652ef5e2a","observation_id":"810fd713-c875-4ffb-842d-55542a02b1bf","resolution":{"observed_at":"2026-08-06T15:26:25.499154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.07991","last_updated":"2021-06-22T21:21:08Z","snapshot_observed_at":"2026-07-06T09:28:59.431672Z","submitted_at":"2020-06-14T19:34:44Z","title":"Emergent Properties of Foveated Perceptual Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.07991","snapshot_observed_at":"2026-08-06T15:26:24.781610Z","title":"Emergent properties of foveated perceptual systems,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.781610Z"},"links":{"cited_paper":"/paper/2006.07991","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:a15da4e3a9afa97204f2421c15407b8bd94728addae27375360b3261da021786","observation_id":"47c9fc71-658c-4f85-9121-f8b073862ab9","resolution":{"observed_at":"2026-08-06T15:26:24.781610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.481890Z","title":"Biologically inspired deep learning model for efficient foveal-peripheral vision,","venue":null,"work_id":"6677eea1-c0f3-42b3-9a7a-0f819eae7de9","year":2021},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.784603Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:650efd5ce3deefb23a0764777123ee6139f4659eed2edcb3c497524348b4c4eb","observation_id":"2e748845-bfc4-43c3-898b-e83baf2d5dfe","resolution":{"observed_at":"2026-08-06T15:26:25.485670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14173","last_updated":"2022-10-02T19:59:49Z","snapshot_observed_at":"2026-07-06T11:13:54.995111Z","submitted_at":"2021-05-29T01:54:33Z","title":"FoveaTer: Foveated Transformer for Image Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14173","snapshot_observed_at":"2026-08-06T15:26:24.787335Z","title":"Foveater: Foveated transformer for image classification,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.787335Z"},"links":{"cited_paper":"/paper/2105.14173","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:e3534a4bf76900658665dd66f6cce4bdd1e9d8793adbc18f756e27d961035601","observation_id":"951fb8fd-cdc0-49b5-9e8e-b5c02e4615d6","resolution":{"observed_at":"2026-08-06T15:26:24.787335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.471569Z","title":"Peripheral vision transformer,","venue":null,"work_id":"7a4e4bf2-3f08-4976-9032-04ef36b14a0c","year":2022},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.790467Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:fa1111fe712aaff0c70ccc4f9bd9b518b10e8ff23ea9e91c5160cdce0c81e7fc","observation_id":"428f0ab1-805a-4257-a633-35a4991b71a0","resolution":{"observed_at":"2026-08-06T15:26:25.474845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.459685Z","title":"An eye-gaze tracking system for teleoperation of a mobile robot,","venue":null,"work_id":"ba29b060-9dab-4e0b-aefc-1c6127af4fb9","year":2018},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.793147Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:833fee4d3373e5de068d9a4c47151a203fb8e41d03c81d99e25ee01cba693f02","observation_id":"017d69eb-54fb-4671-bf3f-860f74b47cf3","resolution":{"observed_at":"2026-08-06T15:26:25.464210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.446771Z","title":"The human gaze helps robots run bravely and efficiently in crowds,","venue":null,"work_id":"98ef95fc-b604-411f-bbfe-8317077f8908","year":2023},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.796342Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:ad954951563a34b325334abde5ad4af386df6b7f0f92cf5251112b31bb287fb5","observation_id":"65a6cf5a-6c50-4924-a0ae-8bed3a150269","resolution":{"observed_at":"2026-08-06T15:26:25.450860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.799515Z","title":"Gaze-based intention estimation: principles, method- ologies, and applications in hri,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.799515Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:24e34907ff60280629fb87effe56e1d4feddf41e88e2c72b9de2a3e71b16bacd","observation_id":"848ce0ca-81f4-4fa7-b6e0-0d1a9c074a5e","resolution":{"observed_at":"2026-08-06T15:26:24.799515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.429445Z","title":"Visarl: Visual reinforcement learning guided by human saliency,","venue":null,"work_id":"2114d698-72ef-4122-a58c-6ab799e62708","year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.802352Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:c1e7db81ed25301900a685e324cd6551f7893cc7bb07fa2393daedf22a22af13","observation_id":"026380ae-af67-45ea-ae5e-f616a70dfa6f","resolution":{"observed_at":"2026-08-06T15:26:25.432702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.805436Z","title":"Eye, robot: Learning to look to act with a bc-rl perception-action loop,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.805436Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:c886f792b13be2b8796ce5c14c4b18b19f4e3c5df21746b34fdbbfd4f2a2f909","observation_id":"4f67658a-517d-46cd-8fad-00f374018f91","resolution":{"observed_at":"2026-08-06T15:26:24.805436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.418675Z","title":"Using human gaze to improve robustness against irrelevant objects in robot manipulation tasks,","venue":null,"work_id":"113d7766-fd1b-440c-91a4-c2ef9898c1b8","year":2020},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.808245Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:3b3c43aca22aa451799b6bcdbac359055898f31b689e0e822c908e0317cd18ea","observation_id":"92743b18-ef07-4803-b0fb-ebea9843e7a2","resolution":{"observed_at":"2026-08-06T15:26:25.422245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.406182Z","title":"Gaze-based dual resolution deep imitation learning for high- precision dexterous robot manipulation,","venue":null,"work_id":"b8b13179-88c1-47a7-ba31-9a00f7486fc7","year":2021},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.811096Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:32cd7f3fd5eea9e21ea1c1011c112bac95d767f4bdd4434ee72167e6b2b18b76","observation_id":"3ed6b318-5ca3-4629-bb99-58e8307b70e8","resolution":{"observed_at":"2026-08-06T15:26:25.410990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:25.392595Z","title":"Multi-task real-robot data with gaze attention for dual-arm fine manipulation,","venue":null,"work_id":"364534f7-e185-45da-b80d-f36427eddf53","year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.814402Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:70f3504965ca0c8ec2ab72cc5b0d18c8c9a80d867e96d3e084e35923908e51f0","observation_id":"77f10773-2874-44ed-b89f-4febcfb395da","resolution":{"observed_at":"2026-08-06T15:26:25.398050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00482","last_updated":"2024-03-11T14:27:48Z","snapshot_observed_at":"2026-07-06T14:47:04.817434Z","submitted_at":"2023-02-01T14:47:17Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00482","snapshot_observed_at":"2026-08-06T15:26:24.817423Z","title":"Improving and generalizing flow-based generative models with minibatch optimal transport,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.817423Z"},"links":{"cited_paper":"/paper/2302.00482","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:4143bc66f81084bbfb497e66b019b06212676f4c12567df79637b70c1020c7e1","observation_id":"a05b25a7-80d9-4da6-91a4-00f8699dfb19","resolution":{"observed_at":"2026-08-06T15:26:24.817423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.820442Z","title":"Affordance-based robot manipulation with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.820442Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:5fdc16c53ecd5688023901bfeab1581df89de81a3146dca9ac27016efa6fa799","observation_id":"0f509454-2616-4c63-be45-7f611e147945","resolution":{"observed_at":"2026-08-06T15:26:24.820442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-06T15:26:24.824013Z","title":"Flow matching for generative modeling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.824013Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:5b2f998f835890b49bfc8ce1f9a3fe5448e42d77bfd45ea57f18f5d995e1d8bc","observation_id":"006f5ce2-f174-4492-a967-d330aec1a913","resolution":{"observed_at":"2026-08-06T15:26:24.824013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.827374Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.827374Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:23f9653e579014715b65b8286361a3b4627080023157d6d85e20592b4b458522","observation_id":"829c3ee5-503a-448c-95cb-91bae424411f","resolution":{"observed_at":"2026-08-06T15:26:24.827374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.830907Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.830907Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:3bb2fd4894b955daef5f15cc9d293cbef743ed736306740fccafa823af0ec171","observation_id":"99343bc7-9761-41f6-9d8d-d17aae6e07e2","resolution":{"observed_at":"2026-08-06T15:26:24.830907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T15:26:24.834469Z","title":"Movie gen: A cast of media foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.834469Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:bafd64f5ba4ebcb8e31f0be9befcddb2f0ff92d07f503c255ca564c447a8b705","observation_id":"28d675ee-7aec-49f7-9bc2-044a2206edf3","resolution":{"observed_at":"2026-08-06T15:26:24.834469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.837714Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.837714Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:bf9a24ae679bb661e0b9e0dd1658ec219da259d7762efa7ede1cc8d1aa3ce24b","observation_id":"ebb6e3eb-131c-4335-aa2e-53f694833eeb","resolution":{"observed_at":"2026-08-06T15:26:24.837714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:26:24.845540Z","title":"Masked autoencoders are scalable vision learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:26:24.845540Z"},"links":{"citing_paper":"/paper/2507.15833"},"observation_digest":"sha256:8102be7688dbc5834a8324467b8f6c1c36ac159c593d3a9305273f8a748d6529","observation_id":"4e8816bd-ffcd-49f3-b1e1-9c38201f351c","resolution":{"observed_at":"2026-08-06T15:26:24.845540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15833","last_updated":"2026-07-13T23:45:05Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-06T15:20:06.611013Z","submitted_at":"2025-07-21T17:44:10Z","title":"Look, Focus, Act: Efficient and Robust Robot Learning via Human Gaze and Foveated Vision Transformers"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 5 inbound Pith citation observations for arXiv:2507.15833."}