{"as_of":"2026-08-07T13:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dc94466f5667b2a0ffb1f6c084e2683e0e83ac89c9f5bbbdb4d32b143c7e2a4f","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:14:25.475997Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02140/citation-record","integrity":"/paper/2608.02140/integrity","json":"/paper/2608.02140/citation-record.json","paper":"/paper/2608.02140"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:37.592826Z","title":"Salisa: Saliency-based input sampling for efficient video object detection, 2022","venue":null,"work_id":"2e546bee-edf2-4306-8f89-8bf9a605d8da","year":2022},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:20.951252Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:b00939e9eb2d1be03ef3b41a36715b1bbf0ffd704b6079a1788015b70dc21333","observation_id":"39d93099-46e5-4adb-823c-7f465bd151f7","resolution":{"observed_at":"2026-08-07T00:14:37.769210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:37.412094Z","title":"Token merging: Your vit but faster","venue":null,"work_id":"e3aa45da-08f4-489c-85a8-321d1c6dfe2a","year":2023},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.027402Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:af820909bfbddc5d61bb2e4c28a3d2bfd83a342e443221dc6c3dc5e9b3e1672e","observation_id":"7371bb67-9e15-4476-bbf1-f3ae9e8f4d25","resolution":{"observed_at":"2026-08-07T00:14:37.483352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:37.141440Z","title":"Visual attention: The past 25 years.Vision Research, 51(13):1484–1525, 2011","venue":null,"work_id":"70d07803-fcc3-4b78-9b62-12da63b121e6","year":2011},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.123738Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:f33b5e784b96cdb4d8fd1e9dd602c2fdeb4230a294b3e03619b77e41ef2b0542","observation_id":"eac8c0d0-25c0-4399-934e-411bec93e46f","resolution":{"observed_at":"2026-08-07T00:14:37.244452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:36.741983Z","title":"Chen, Chengkuan Chen, Yicong Li, Tiffany Y","venue":null,"work_id":"7dc5922b-2f2e-4e8c-ab35-ec89f03be87f","year":2022},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.223499Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:0fe9e28e0159b42585997fc7e864f24a14805e217d3e9637fbe29dddfc6c2e3f","observation_id":"8e55fd1f-2883-4bad-b668-a0c0d980f5ac","resolution":{"observed_at":"2026-08-07T00:14:36.971991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:36.393814Z","title":"Training deep nets with sublinear memory cost, 2016","venue":null,"work_id":"4179e2fa-32c8-45f4-93dd-f52d6f3893d5","year":2016},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.322402Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:8c709a4716ed3b9d0ee26392e51db6ce91a8bb8c7d450bb36cf5d9d8267418f2","observation_id":"ab37e6f2-cda1-4be3-8fe8-4d5e84284aec","resolution":{"observed_at":"2026-08-07T00:14:36.545816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:36.023958Z","title":"Dynamic convolution: At- tention over convolution kernels","venue":null,"work_id":"73d04184-e3b1-4bdb-a246-14f42ba4f0b2","year":2020},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.401664Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:4e494fde9a1bd0804fff49ba981c5d9a87b9d53c53035a657eadb26f827eca2b","observation_id":"4e4efe44-c4b1-418f-8de4-f793b2ebaff5","resolution":{"observed_at":"2026-08-07T00:14:36.187819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:35.699371Z","title":"Curcio, Kenneth R","venue":null,"work_id":"80867c12-9414-4975-bfb5-2ffb0899f9f7","year":1990},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.485707Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:849f7d6ecf14bd7dd4972a98b6c91e270cd3746c332030e52aa1d980c9631cc8","observation_id":"8c1489d9-7efb-4bbc-aee4-15778ab4b40b","resolution":{"observed_at":"2026-08-07T00:14:35.843112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:35.536841Z","title":"Deformable convolutional networks","venue":null,"work_id":"ff7d8a49-abb7-4d5f-8acc-408c30d72438","year":2017},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.562586Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:ad375d6c860c03f49d454eab084cec6069f069e9ac4e6681a3bce88d2f6136d8","observation_id":"bbc3331b-526e-4efb-a747-e1a30df9f91e","resolution":{"observed_at":"2026-08-07T00:14:35.623475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:35.339221Z","title":"Scaling egocentric vision: The EPIC- KITCHENS dataset","venue":null,"work_id":"5060ca95-b3d6-40a6-913a-880e3c7b4c08","year":2018},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.676508Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:7ba22e8d7aacf30f79c58281aab4f9d59d8b31f7c11172fecb2926b845c6dbce","observation_id":"aeed5140-af3a-4f5e-8fc4-fe0547ef5a2e","resolution":{"observed_at":"2026-08-07T00:14:35.429545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:21.755022Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.755022Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:e927158d7fbf9a7de2d64cd642a9ef011623bcfc23b2951fea6262efd74c08ee","observation_id":"fb3a6f98-6ee0-4429-b273-f02eb5a4ba9f","resolution":{"observed_at":"2026-08-07T00:14:21.755022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:35.163327Z","title":"Saccader: Improving accuracy of hard attention models for vision","venue":null,"work_id":"0958558e-b605-4d96-8603-2320594fc32a","year":2019},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.833199Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:647e32484113f2ed16c87a406389f75c0b9947f2d8e320c8f0ae0409f578d6fd","observation_id":"9395121c-b384-4133-aa99-1c1172b33509","resolution":{"observed_at":"2026-08-07T00:14:35.231781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:35.015868Z","title":"Polar transformer networks","venue":null,"work_id":"d696935d-1935-4c85-a9d0-4087112fa96d","year":2018},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.909274Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:4e59caa249ef51a5608878607f0dcc3a070387532d5d065104163e872865e159","observation_id":"13aaf446-b4ff-444e-9375-00f027406275","resolution":{"observed_at":"2026-08-07T00:14:35.070883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:34.882197Z","title":"Multiscale vision transformers","venue":null,"work_id":"b89b3b4c-29cb-4ec4-bbe4-24d7a704c204","year":2021},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:21.983151Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:8b18381b2612e84949de2b9080272e5f819640ed9f78954966fd692c20822b63","observation_id":"47062acf-e491-4b89-966f-1ff682b407df","resolution":{"observed_at":"2026-08-07T00:14:34.963873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:34.584358Z","title":"Morariu, and Larry S","venue":null,"work_id":"27591842-f90d-4740-bdd1-e84ddd625157","year":2018},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.097909Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:627caac7ea7d59a1a3f2b3bca1be6b4d772ec3140be5b268c6fdd85783caa538","observation_id":"83e5f4f5-7d3d-4a7a-b19b-4493077aa3d8","resolution":{"observed_at":"2026-08-07T00:14:34.783277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.03702","last_updated":"2019-05-17T16:18:02Z","snapshot_observed_at":"2026-08-01T20:55:40.805763Z","submitted_at":"2019-04-30T17:47:53Z","title":"OpenEDS: Open Eye Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.03702","snapshot_observed_at":"2026-08-07T00:14:22.145123Z","title":"Garbin, Yiru Shen, Dushyant Goodman, Jakob H","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.145123Z"},"links":{"cited_paper":"/paper/1905.03702","citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:abc74b184ef23f36e26cc6185bae2a231f4b6388ab22ed9965a66967a36f20e7","observation_id":"a24f6120-40b8-4f0d-8584-63efac4bcff8","resolution":{"observed_at":"2026-08-07T00:14:22.145123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:34.338915Z","title":"Ego4D: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"195f47f7-6667-4277-91ed-3f2e3a437103","year":2022},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.262082Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:aa224d1a20dd06d9fb9888cb7e9bf0f517a5d7ef61b5449a8aa7a5e2e3c8a686","observation_id":"71b26f88-9e5c-4b1d-b297-36512f30726f","resolution":{"observed_at":"2026-08-07T00:14:34.430055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:34.087462Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"f59bea94-7a29-49c6-a4aa-4bdd50e69099","year":2016},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.366173Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:f1b2abe2adb774a7bf21b8d2531b2c6d1ef699ab0cc4ddea34612493c05c4424","observation_id":"be3ba4d7-d811-44f3-9ea2-3b077756687d","resolution":{"observed_at":"2026-08-07T00:14:34.221649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:33.794528Z","title":"Warped convolutions: Efficient invariance to spatial transformations","venue":null,"work_id":"cbac67eb-969c-4c3a-918b-d34c5511c8ee","year":2017},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.483789Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:2b6331c8eaaba1d147f1926cd15b4b90d4852bd85c5c92eed60a6a13bf810980","observation_id":"5e31afb7-777c-4f4d-b0b3-20d082463b68","resolution":{"observed_at":"2026-08-07T00:14:33.930685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:33.627264Z","title":"Spatial transformer networks","venue":null,"work_id":"4c804264-39e1-49b5-8526-d9cf496c53a1","year":2015},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.556573Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:8b57f318d54b2913bea03987b4294c9482bbf8d5cdcc62f55801804509f8b034","observation_id":"dfaf410b-be17-4a34-bf95-20afb520e094","resolution":{"observed_at":"2026-08-07T00:14:33.691720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:33.468880Z","title":"Ultralytics yolo11, 2024","venue":null,"work_id":"6b39e7e9-1283-4fa4-afef-9c5c28dcebcc","year":2024},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.672709Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:a358d9af7cbe178f820703914b29860c2b45be2b9800d0cf8bc965b9bf662113","observation_id":"126d8551-2591-4ab8-a14f-0436d4746140","resolution":{"observed_at":"2026-08-07T00:14:33.553629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14173","last_updated":"2022-10-02T19:59:49Z","snapshot_observed_at":"2026-07-06T11:13:54.995111Z","submitted_at":"2021-05-29T01:54:33Z","title":"FoveaTer: Foveated Transformer for Image Classification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.14173","snapshot_observed_at":"2026-08-07T00:14:22.743370Z","title":"Manjunath, and Miguel P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.743370Z"},"links":{"cited_paper":"/paper/2105.14173","citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:30fbb75f5d2728f5616c04f07e82f34d96d3707263677f31a6fd551a8cf01ddf","observation_id":"2f4d104b-5cf2-4d19-bca9-9b3b5da89ffa","resolution":{"observed_at":"2026-08-07T00:14:22.743370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:33.241961Z","title":"Gaze360: Physically uncon- strained gaze estimation in the wild","venue":null,"work_id":"b59360d1-4f3b-4bce-bb84-ae13325d0b38","year":2019},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.822761Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:8734e219266ea96be7c4feb976678a27e9e5bfc6e28ebf1b16437edfcb8384fc","observation_id":"72098f59-2090-4b60-878f-02888182699c","resolution":{"observed_at":"2026-08-07T00:14:33.330669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:33.057273Z","title":"Paul Siebert","venue":null,"work_id":"729f376f-c24a-457a-8277-56c545a7cb01","year":2022},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.895006Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:340a52d5c3b9667b6f7d01aad358ea741629b36612632971554ed6b11dfaf7f1","observation_id":"ed33294c-e00f-4126-9bfd-93aac9518441","resolution":{"observed_at":"2026-08-07T00:14:33.155273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:32.911921Z","title":"Foveation in the era of deep learn- ing","venue":null,"work_id":"82518bea-bbf2-4f4a-be67-3a3d27b48576","year":2023},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:22.967801Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:1a57940a6a95c508429a34cbe5681687186f821339ea31cd1b9c9e23230c9625","observation_id":"4434ea8e-e5ea-4ce9-8ae5-722bbed35667","resolution":{"observed_at":"2026-08-07T00:14:32.978588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:32.734018Z","title":"In the eye of transformer: Global–local correlation for egocentric gaze estimation and beyond.International Journal of Com- puter Vision, pages 1–18, 2023","venue":null,"work_id":"00c3bb4e-24bf-4c68-a372-639f1a9db232","year":2023},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.003262Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:10854f07f9c707344a33415dcd7e36cd92e7a94157a5adab11d1be1c52eb245b","observation_id":"3692e6b0-1315-4253-b8a9-5c081ca02365","resolution":{"observed_at":"2026-08-07T00:14:32.812219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:32.536307Z","title":"Learning to combine foveal glimpses with a third-order boltzmann ma- chine","venue":null,"work_id":"a29af629-550e-4049-8641-016615c1512e","year":2010},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.079261Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:cddc4f8a6dc667187ec1a7c76ad77ee957737fd2d7f2c85f6ff9f505f8c197e6","observation_id":"0241eea4-9a19-4c05-bc27-5d31da85355c","resolution":{"observed_at":"2026-08-07T00:14:32.632498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:32.330872Z","title":"Froehlich, Yuhang Zhao, and Yapeng Tian","venue":null,"work_id":"f0dfb28b-7a55-4436-a5e9-d0b30d5f9526","year":2026},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.155844Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:334146b19de1ac32569488d1a7b0299da69b8a3eec1f1f1562b32d9efd0e7d4e","observation_id":"e4ec6a0c-f81e-4e0c-9a00-d23503c2c0ec","resolution":{"observed_at":"2026-08-07T00:14:32.403055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:32.142665Z","title":null,"venue":null,"work_id":"bc7f4d30-9820-4135-a00c-c689b1a7f58f","year":null},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.242020Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:d44d1f794074fc3625ab3b327f2d3bb78d1c472595549c9361d0d55d8ea2bf4c","observation_id":"2c92cd68-272b-4c0c-8fe9-077fc29ce6e7","resolution":{"observed_at":"2026-08-07T00:14:32.227705Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:31.973758Z","title":"MViTv2: Improved multiscale vision transformers for classification and detection","venue":null,"work_id":"70ebe99e-31b5-4d18-bbbf-992fe54b01a9","year":2022},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.309978Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:7d69d3f69b15ee21fd262373d1cf87031c1a89dfafc4853ac0474440c44bbf66","observation_id":"15cb780a-a20f-4a38-9c83-1a57dc20e3b0","resolution":{"observed_at":"2026-08-07T00:14:32.053321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:31.752741Z","title":"Evit: Expediting vision transform- ers via token reorganizations","venue":null,"work_id":"8d0faaf8-d600-454c-a939-a2d8470eda98","year":2022},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.433143Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:af684a11418140fff893259d251a4e3e417e6964551b34a62de64ae8e75db858","observation_id":"b7ffbddd-e7b2-4bd1-88fe-474e826a9b7d","resolution":{"observed_at":"2026-08-07T00:14:31.884586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:31.611840Z","title":"Girshick, Kaiming He, Bharath Hariharan, and Serge Belongie","venue":null,"work_id":"c374199e-515c-4cfb-8cbe-697741f0c542","year":2017},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.540219Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:4fe96fcdf7029a6c6fa6a41848d41f9acd7c31080350189aa952c2f3e20b3890","observation_id":"e3241e3b-6f3a-44fd-9928-e8cd3f7f696b","resolution":{"observed_at":"2026-08-07T00:14:31.689385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:31.458277Z","title":"Girshick, Kaiming He, and Piotr Doll ´ar","venue":null,"work_id":"3e1eba3a-5fc7-44d8-8a7e-34daa7660911","year":2017},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.635662Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:7ff7e4b85695ab4f97bc32386f79f8e66d95a6bdea76da24b85fcecd30e2e84a","observation_id":"e7f178be-44bc-435f-ac49-26f3b25739af","resolution":{"observed_at":"2026-08-07T00:14:31.543154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:31.275240Z","title":"A convnet for the 2020s","venue":null,"work_id":"8d0ab1e1-1d14-43fe-adc5-a5ed4ae85e46","year":2022},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.720590Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:0466dd8a317b7f0d6101daa6305dc27eb2eeaa5d2793c90a700a99b9e524f3c8","observation_id":"0f180f9d-e91e-454e-a8e9-1e0211c22524","resolution":{"observed_at":"2026-08-07T00:14:31.362054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:31.135422Z","title":"Lu, Drew F.K","venue":null,"work_id":"d1a97704-a9d7-4e1b-bc46-9a960871cc19","year":2021},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.826397Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:ef7bb2b4571eff029d68f65814fa1ea667a5554114c273b440b6d991800d0dd4","observation_id":"fedd34f5-5a76-4943-a430-6e10aa4b66ca","resolution":{"observed_at":"2026-08-07T00:14:31.201423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:30.869112Z","title":"Kernel foveated rendering.Proceedings of the ACM on Computer Graphics and Interactive Techniques, 1: 1–20, 2018","venue":null,"work_id":"62de0b64-ff07-4108-8609-f7776ccf71c3","year":2018},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:23.920984Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:104d0cbf22bd238968908ba6b8e518bc22585ae71f5f2c3de7a4b9f62156efee","observation_id":"33b08386-29dc-48b0-a385-6a2ba6d0fb52","resolution":{"observed_at":"2026-08-07T00:14:30.995159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:30.491278Z","title":"Recurrent models of visual attention","venue":null,"work_id":"7bf7c87c-9c1e-4134-a5e1-a1e68b921051","year":2014},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.029957Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:472be9a910096b463042e93bb17c0efc62542a6f896412605fe031c0ce7dde31","observation_id":"ff18f448-aa79-4cab-9e66-261af40602f5","resolution":{"observed_at":"2026-08-07T00:14:30.685812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:30.129602Z","title":"Emergence of Fixational and Saccadic Movements in a Multi-level Recurrent Attention Model for Vision, page 299–313","venue":null,"work_id":"c3cbae29-96cc-4d3c-b396-4b862f3430d7","year":2025},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.107892Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:cb4bce678cd5e7cb702d937d85f1abc2c5c299428643620525d82d585f55636e","observation_id":"ac8d7524-8875-4f3d-9d42-1b4fbcbc382c","resolution":{"observed_at":"2026-08-07T00:14:30.300661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:29.795095Z","title":"HD-EPIC: A highly-detailed egocentric video dataset","venue":null,"work_id":"77370a29-7ea7-4d28-b058-525025b19fac","year":2025},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.202937Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:da58c543bb34fc5ab423999de59c07874eab6ebc28f42d3dbe0da07b323329dc","observation_id":"e065e806-7898-4141-8205-cc68bf2a2067","resolution":{"observed_at":"2026-08-07T00:14:29.941475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:29.427626Z","title":"Paco: Parts and attributes of common objects","venue":null,"work_id":"1d501749-3e47-46eb-bb14-a7e99e170102","year":2023},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.294641Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:5f18a4fa7d0f9758d7376c0b39ec3ab7a999007bbfaa44ac6e0480737a7c0c85","observation_id":"3f351fb0-bc66-4de5-b5ce-2227d6e20bb7","resolution":{"observed_at":"2026-08-07T00:14:29.635077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:29.070024Z","title":"Dynamicvit: Efficient vision transformers with dynamic token sparsification","venue":null,"work_id":"56cd4a88-8080-484e-b6c6-fde4ca34bc8a","year":2021},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.336273Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:f8ddaa95e4c61d520556b7a3e548e6189d608f2d668bb76b147fcd211d2684ee","observation_id":"ec429570-7118-4378-b905-a066fd5693ba","resolution":{"observed_at":"2026-08-07T00:14:29.206461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:28.753545Z","title":"Learning to zoom: a saliency- based sampling layer for neural networks","venue":null,"work_id":"6e74ae7c-bd35-45d8-8909-3a15a2d41984","year":2018},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.459371Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:1790bee1e08c0e41922d47566624ccd966855284b09070c0526e6b0944ede8a5","observation_id":"96f2650a-f6e8-4c54-8a2b-e71a664c8106","resolution":{"observed_at":"2026-08-07T00:14:28.928567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:28.448565Z","title":"Balas, and Livia Ilie","venue":null,"work_id":"048305d8-0700-459c-a025-237ff37c4379","year":2012},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.532310Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:a8003fdbc5bdb7a6b77f701076467daa97b54bf8f83bf2dcd559c1c5081976f8","observation_id":"8b646702-65d9-4c50-a742-3806c6e15836","resolution":{"observed_at":"2026-08-07T00:14:28.599325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:28.149671Z","title":"Schwartz","venue":null,"work_id":"774c7e22-1c12-4323-842e-6c25a09e75cb","year":1977},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.617529Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:8ae5618e6ff1ad839f4bcbfce19b1b7b5e9cf284dea00425d79fe7dc368c75a1","observation_id":"92678975-17b9-4c24-af5e-12be641dbff4","resolution":{"observed_at":"2026-08-07T00:14:28.302471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:27.825036Z","title":"Computational anatomy and functional ar- chitecture of striate cortex: A spatial mapping approach to perceptual coding.Vision Research, 20(8):645–669, 1980","venue":null,"work_id":"608c7187-8d11-4e82-b8b9-ffeadef26581","year":1980},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.706436Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:4f16f56102e1c5c92fdd24a84fe355019c3dd988bf607254c2e21abef2d3fb07","observation_id":"2a9d3fd1-3180-4605-961c-eea389224cac","resolution":{"observed_at":"2026-08-07T00:14:27.985650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:27.565231Z","title":"Pe- ripheral vision and pattern recognition: A review.Journal of Vision, 11(5):13–13, 2011","venue":null,"work_id":"3f3181dd-8790-4074-85ac-865f52115acb","year":2011},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.789771Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:f523d50b19a55bd58f51c1fc1900580ce8bdef441edeabac53473f3dce0b22bf","observation_id":"0fe5a730-c599-4c23-b656-823401d96121","resolution":{"observed_at":"2026-08-07T00:14:27.709046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:27.256846Z","title":"Log-polar space convolution lay- ers","venue":null,"work_id":"ccc293e5-e61e-45a5-a321-1c804d52c248","year":null},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.865466Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:6a0f402ad3241c442d5c9d24032603eb928bc728c1b9392e0992b9c1bfe88065","observation_id":"9994b6b6-0b04-484f-aca7-31710e3a1298","resolution":{"observed_at":"2026-08-07T00:14:27.406001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:26.856150Z","title":"Deep high-resolution representation learning for human pose es- timation","venue":null,"work_id":"8cbd5668-708f-4f54-9022-92e6c4c32093","year":2019},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:24.953238Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:b6b2887f1c8c7fb37784b5cd9aca06bf1133c0789d0b4cd4189693b52eaf04f3","observation_id":"327c75ef-e13c-4eda-9958-f05453cf3e3f","resolution":{"observed_at":"2026-08-07T00:14:27.043632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:26.610950Z","title":"Fovea: Foveated image magnification for autonomous navigation","venue":null,"work_id":"ab701c68-3d77-40f4-9252-ec7e835e7fe7","year":2021},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:25.043179Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:70767108cdc69dd929b55f6b7a3610cfddb65d2e2166454c2c722a0fbcfbe184","observation_id":"49b6ce86-6ca3-4eec-8c47-b5fe7a86fa67","resolution":{"observed_at":"2026-08-07T00:14:26.723006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:26.377304Z","title":"Deep high-resolution representation learning for visual recogni- tion.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2020","venue":null,"work_id":"971d641c-78a6-4c6b-8a58-6ac424c3ae8d","year":2020},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:25.129879Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:5f612d8aaae65787941b798dc6c877b325e4f6ea7ae4194b24d189a3b9cb6922","observation_id":"21d68452-2754-4745-b195-54f7aa0ff2e2","resolution":{"observed_at":"2026-08-07T00:14:26.465187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:26.114420Z","title":"Zoom-in-net: Deep mining lesions for diabetic retinopathy detection","venue":null,"work_id":"e5d9de47-ebac-400f-b2d4-6e14cd20e407","year":2017},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:25.216947Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:8673a70ebc1e0921bc36da4fc34b896269fb8c2cf377f0fdbdd96b2c53b37066","observation_id":"8f825579-1807-4f51-a452-704300cfe8ec","resolution":{"observed_at":"2026-08-07T00:14:26.232723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:25.825610Z","title":"No time to waste: Squeeze time into channel for mobile video understanding, 2024","venue":null,"work_id":"52886608-68f2-4e83-ab8d-aa82ddf1a0c6","year":2024},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:25.310296Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:2b86f9f4174c90a71f0b9fa6363652cd5ea720caf1a68d6d7d37640dbd8eb440","observation_id":"6eee9076-2884-4171-9aaf-f193a5da1034","resolution":{"observed_at":"2026-08-07T00:14:25.959130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:25.393751Z","title":"MPIIGaze: Real-world dataset and deep appearance-based gaze estimation.IEEE Transactions on Pattern Analysis and Machine Intelligence, 41(1):162–175,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:25.393751Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:113be532902374c3ce50c88615849725ebc99b9baf09614463b80f3e3ee24090","observation_id":"bd9224c3-19bf-49e1-b84a-18e43c68e664","resolution":{"observed_at":"2026-08-07T00:14:25.393751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:14:25.591727Z","title":"ETH-XGaze: A large scale dataset for gaze estimation under extreme head pose and gaze variation","venue":null,"work_id":"f34ee688-a7fa-482a-84ba-56e90b67ed04","year":2020},"citing_paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:25.475997Z"},"links":{"citing_paper":"/paper/2608.02140"},"observation_digest":"sha256:608d75104e8f9f81df1de3c57b6242a5ce739dc0b6d45cbca73665a167d631f0","observation_id":"f239ae06-776a-43e5-ac3c-b9b8219b9e61","resolution":{"observed_at":"2026-08-07T00:14:25.689069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.02140","last_updated":"2026-08-05T14:57:15Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:55:29.424580Z","submitted_at":"2026-08-03T12:28:11Z","title":"HiResNets: Native Full-HD Video Recognition with Foveal Residual Streams"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":48},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2608.02140."}