{"as_of":"2026-08-05T06:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:34b54bef1fed5ffe8e7bb768186348144c1b25eb14d1b8cde9675bbbbc24d0ea","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:59:18.438342Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14497/citation-record","integrity":"/paper/2607.14497/integrity","json":"/paper/2607.14497/citation-record.json","paper":"/paper/2607.14497"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:14.673764Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:14.673764Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:407e2b43b7c91ba27b33292a2ecc29c906b14d08ed74eac06f3d9079b733fb49","observation_id":"87102886-f169-4b84-a307-920d8b8cf547","resolution":{"observed_at":"2026-08-02T01:59:14.673764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-02T01:59:14.709112Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:14.709112Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:e3c38af65dcfa2f527607a40b23d9c796878c91bcd2325686d9a4811bdd0ac78","observation_id":"d1baaa2c-29cd-459b-8cd8-0bd917856433","resolution":{"observed_at":"2026-08-02T01:59:14.709112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:14.760465Z","title":"Where did i leave my keys?- episodic-memory-based question answering on egocentric videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:14.760465Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:4f3e0fe96df211c9f09f1ed3adf09f37c4e44ecfd15b53fba93b31087c3a034c","observation_id":"c6563afa-6cfa-45d2-b7a5-fa893b1a44db","resolution":{"observed_at":"2026-08-02T01:59:14.760465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:14.813459Z","title":"Ad- abins: Depth estimation using adaptive bins","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:14.813459Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:b8d812c438e019ee36431bf21f9837584dc0ea587c503c597386f21b6dbea5a5","observation_id":"ba5afb2f-81d0-4d25-bcfd-99e37fb528cc","resolution":{"observed_at":"2026-08-02T01:59:14.813459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:14.889620Z","title":"Local- bins: Improving depth estimation by learning local distributions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:14.889620Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:294d11ea1925be5b55712bf2960b9638233ca32524e82f8733d2be7b14b4dab0","observation_id":"53c3138e-a0d3-48de-b8b1-ae1269a4eec2","resolution":{"observed_at":"2026-08-02T01:59:14.889620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12288","last_updated":"2023-02-23T19:13:10Z","snapshot_observed_at":"2026-07-06T14:55:15.719380Z","submitted_at":"2023-02-23T19:13:10Z","title":"ZoeDepth: Zero-shot Transfer by Combining Relative and Metric Depth","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12288","snapshot_observed_at":"2026-08-02T01:59:14.973132Z","title":"Zoedepth: Zero-shot transfer by combining relative and metric depth.arXiv preprint arXiv:2302.12288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:14.973132Z"},"links":{"cited_paper":"/paper/2302.12288","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:165890ec3b030388684760e033f1ee133aa58e4a24f0633c63c65874dbf5ae5f","observation_id":"c913e4c3-f841-42a2-a44e-5bb888d908cd","resolution":{"observed_at":"2026-08-02T01:59:14.973132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.051371Z","title":"Scene text visual question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.051371Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:ebb2f51013a2666105fc7602b52038f41fd6d54591668c2033c2835e5dff43de","observation_id":"b00dd320-b97d-4d9c-b48c-de6115cbe39c","resolution":{"observed_at":"2026-08-02T01:59:15.051371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02073","last_updated":"2025-04-21T12:09:08Z","snapshot_observed_at":"2026-08-02T06:32:26.688405Z","submitted_at":"2024-10-02T22:42:20Z","title":"Depth Pro: Sharp Monocular Metric Depth in Less Than a Second","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02073","snapshot_observed_at":"2026-08-02T01:59:15.110105Z","title":"Depth pro: Sharp monocular metric depth in less than a second.arXiv preprint arXiv:2410.02073, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.110105Z"},"links":{"cited_paper":"/paper/2410.02073","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:fed0940b2338eeb87c478fc05cfcb52c64d128bed1e4d3ff2b81f2c567cf69e0","observation_id":"0904920c-fad8-4d7d-861f-109b43a2e7b4","resolution":{"observed_at":"2026-08-02T01:59:15.110105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.160109Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.160109Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:e36b9e62085a9d31c9a616c4ce051c687bce12be2c021f7337f588153b6ab724","observation_id":"eb49d6b0-ea75-4ba5-ad42-13c9129251b5","resolution":{"observed_at":"2026-08-02T01:59:15.160109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11623","last_updated":"2024-10-15T14:08:53Z","snapshot_observed_at":"2026-07-06T19:33:52.737083Z","submitted_at":"2024-10-15T14:08:53Z","title":"VidEgoThink: Assessing Egocentric Video Understanding Capabilities for Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11623","snapshot_observed_at":"2026-08-02T01:59:15.211777Z","title":"Videgothink: As- sessing egocentric video understanding capabilities for embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.211777Z"},"links":{"cited_paper":"/paper/2410.11623","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:be40fcc7cc05cbbf00afe97a43a418a08fad07199952e1f742e8213ae1eeeb1b","observation_id":"edc05bd7-0390-45f0-82c1-7042fad95dfe","resolution":{"observed_at":"2026-08-02T01:59:15.211777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.261373Z","title":"Egothink: Evaluating first-person per- spective thinking capability of vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.261373Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:3f8351d3418f5a667f44d8a10796ac45dffb9337dbdafa43820fcdb1eabbb725","observation_id":"4e551c8d-b69d-4ceb-a583-a5fa3b571b01","resolution":{"observed_at":"2026-08-02T01:59:15.261373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.307319Z","title":"In- structblip: Towards general-purpose vision-language models with in- struction tuning.Advances in neural information processing systems, 36:49250–49267, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.307319Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:cd2122c58f7cf6104d372c1abfb3887d8d4c86900eb1021e02f04d588e2e1b6f","observation_id":"7200e93a-5def-46fe-bcb1-3cace70790b4","resolution":{"observed_at":"2026-08-02T01:59:15.307319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.366901Z","title":"Egovqa-an egocentric video question answering benchmark dataset","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.366901Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:f8f908fd88ada665e642d58be0ddc1368e6fffcfa0800cf097ebb424f30407f9","observation_id":"7c6fbf91-1078-4122-86ee-f7e220cad36c","resolution":{"observed_at":"2026-08-02T01:59:15.366901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.370801Z","title":"Deep ordinal regression network for monocular depth estimation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.370801Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:d2840312fb3a43b923ba5f0fb349a4b5d20004d3a4451621c901a0dc0c3b1b60","observation_id":"64d09369-925b-4cb3-955f-c0ca4032c1ef","resolution":{"observed_at":"2026-08-02T01:59:15.370801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.386825Z","title":"Geowizard: Unleash- ing the diffusion priors for 3d geometry estimation from a single im- age","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.386825Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:0614728d042350e2f08c1d8ffca12462bf17ca8859f4e8b173daa25de4f6b0a9","observation_id":"a68823fd-3ddf-4389-a26b-3b300c8eedd2","resolution":{"observed_at":"2026-08-02T01:59:15.386825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.496125Z","title":"Unsu- pervised monocular depth estimation with left-right consistency","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.496125Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:87ad6de10e41b36e568ea9f5c43b5aaabb5e4177161bd73b00183e31fa5f6423","observation_id":"a0f02a9a-0189-407b-8ee2-f0ac16bb1249","resolution":{"observed_at":"2026-08-02T01:59:15.496125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.635625Z","title":"Digging into self-supervised monocular depth estimation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.635625Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:7bc1d19e657befa9a138a43cf9e459e4fc7648527cebbf8cef7a5f9f37e9073e","observation_id":"8dfe3c77-c5b6-4d0e-9487-613d8a9f0a94","resolution":{"observed_at":"2026-08-02T01:59:15.635625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.715378Z","title":"Depthfm: Fast generative monocular depth estimation with flow matching","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.715378Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:7b1dee4d95d8d2b3c51a3951f97f19035e145be408da092d7853488de5061bfb","observation_id":"bfd9642e-3138-4ad4-90fd-e6b1130a8b85","resolution":{"observed_at":"2026-08-02T01:59:15.715378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.800762Z","title":"Towards zero-shot scale-aware monocular depth es- timation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.800762Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:5c3e7c1cb2035b4a4ed9738127f0c6c86a1d7c5ca360baad781fa2a3711fca50","observation_id":"b6a72b5d-c784-499e-b672-ae41c181adca","resolution":{"observed_at":"2026-08-02T01:59:15.800762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.915084Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.915084Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:5af0d11913d719bd2f1fb3d11f72ad681f17f49787763deba5c20077ebf3d3e3","observation_id":"1043def6-f760-4ee6-a3ee-efca78ed658f","resolution":{"observed_at":"2026-08-02T01:59:15.915084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:15.989903Z","title":"Ego- taskqa: Understanding human tasks in egocentric videos.Advances in Neural Information Processing Systems, 35:3343–3360, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:15.989903Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:c2b82bd95807fddb8525da41e625a21e34712dc36c50062d104faf8a49084810","observation_id":"c3d7ac6d-e563-47cd-95ef-b71a75f18254","resolution":{"observed_at":"2026-08-02T01:59:15.989903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:16.054865Z","title":"Repurposing diffusion- based image generators for monocular depth estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.054865Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:9c9c1753cbfbe248cfd89f44ab24f48ab07952b19857cd4e8b7e6fbc39a3f3d7","observation_id":"bedfa933-1617-41d8-be95-6468ee25ca17","resolution":{"observed_at":"2026-08-02T01:59:16.054865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-02T01:59:16.130687Z","title":"Llava-next-interleave: Tackling multi- image, video, and 3d in large multimodal models.arXiv preprint arXiv:2407.07895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.130687Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:e29c2919e7047a62efbd12e94b15a8ff8e0809c6778ccbb0ab4e960f1c3ef364","observation_id":"aac8e7bc-8820-4dba-a97b-c697b76ec942","resolution":{"observed_at":"2026-08-02T01:59:16.130687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:16.237961Z","title":"Egocross: Benchmarking multimodal large language models for cross- domain egocentric video question answering.arXiv preprint arXiv:2508.10729, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.237961Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:cc90b7fb762bc961c1a52fb13e399fce3359c1201349ed7e88c4c4fe9dcd208d","observation_id":"f2837398-d58e-4ca5-9547-b1366468f428","resolution":{"observed_at":"2026-08-02T01:59:16.237961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00987","last_updated":"2022-04-03T04:38:02Z","snapshot_observed_at":"2026-07-06T12:56:04.298366Z","submitted_at":"2022-04-03T04:38:02Z","title":"BinsFormer: Revisiting Adaptive Bins for Monocular Depth Estimation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.00987","snapshot_observed_at":"2026-08-02T01:59:16.314451Z","title":"Bins- former: Revisiting adaptive bins for monocular depth estimation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.314451Z"},"links":{"cited_paper":"/paper/2204.00987","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:c08250525b7dd44a1f23354c5b621fd0e4cd2469d28299487d7ffd12d166bd17","observation_id":"3ee1175e-1636-415f-a0b1-67519baae3d8","resolution":{"observed_at":"2026-08-02T01:59:16.314451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:16.396078Z","title":"Patchfusion: An end-to-end tile-based framework for high-resolution monocular met- ric depth estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.396078Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:967c6ed42766ecee045b3b31ccecb60d80891574861c793868112bb6bf8d638c","observation_id":"8b4ab995-c0aa-4481-b14c-79666e8cd61d","resolution":{"observed_at":"2026-08-02T01:59:16.396078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:16.465821Z","title":"Unibind: Llm-augmented unified and balanced representation space to bind them all","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.465821Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:cbd4f724d624a10519779429b48e8886d8bc66359b3d2a0853c83497eb681f94","observation_id":"4e457fda-1d07-4c99-af11-3dc7964ebf5b","resolution":{"observed_at":"2026-08-02T01:59:16.465821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:16.610317Z","title":"Realrag: Retrieval- augmented realistic image generation via self-reflective contrastive learning.arXiv preprint arXiv:2502.00848, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.610317Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:e45310e0f9638f9d68d97632cf4b6afa337a492c959d0dbb045bdbe71d12491a","observation_id":"63523dd7-515a-4f88-a91d-3a270c51eab6","resolution":{"observed_at":"2026-08-02T01:59:16.610317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:16.686243Z","title":"Single image depth estimation: An overview.Digital Signal Processing, 123: 103441, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.686243Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:c18d9fe24c517cbe583c99dcab842eab902413a9e3bab75172f207733c4a7b01","observation_id":"f9a25bdb-33de-4010-8f4d-d7ec315278b4","resolution":{"observed_at":"2026-08-02T01:59:16.686243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20110","last_updated":"2025-12-18T09:32:11Z","snapshot_observed_at":"2026-08-02T05:41:31.119340Z","submitted_at":"2025-02-27T14:03:15Z","title":"UniDepthV2: Universal Monocular Metric Depth Estimation Made Simpler","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20110","snapshot_observed_at":"2026-08-02T01:59:16.809240Z","title":"Unidepthv2: Univer- sal monocular metric depth estimation made simpler.arXiv preprint arXiv:2502.20110, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.809240Z"},"links":{"cited_paper":"/paper/2502.20110","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:9e026334bd560f9cafb59886b076f4b996a1d6a2c0d6ab94d1f56d8637e4628c","observation_id":"75867d58-7767-4496-b5a4-60dd58376bac","resolution":{"observed_at":"2026-08-02T01:59:16.809240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:16.895759Z","title":"Towards robust monocular depth estimation: Mix- ing datasets for zero-shot cross-dataset transfer.IEEE transactions on pattern analysis and machine intelligence, 44(3):1623–1637,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.895759Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:c569652e946b52ec0c532634fc923f22c5e86ad620e1816d69070e6f335effcf","observation_id":"19aa8d47-db44-4ab3-8735-4d50f542d48e","resolution":{"observed_at":"2026-08-02T01:59:16.895759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:16.960864Z","title":"Monocular depth estimation us- ing neural regression forest","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:16.960864Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:6f083598f64380b4e96cf442c6859c67a04b14b14fe168a5b061e384d48d660d","observation_id":"aa72a3f3-6776-49ce-a8db-4fe5854726ee","resolution":{"observed_at":"2026-08-02T01:59:16.960864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:17.077636Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:17.077636Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:71b93cd2cc7e903858b5f5d4145bd3b556762c80f2a0d767f521314e50297688","observation_id":"e09c48aa-acf9-4216-90f2-c1c3b39690db","resolution":{"observed_at":"2026-08-02T01:59:17.077636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13807","last_updated":"2024-06-21T09:53:41Z","snapshot_observed_at":"2026-07-06T18:33:54.443005Z","submitted_at":"2024-06-19T20:14:14Z","title":"AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13807","snapshot_observed_at":"2026-08-02T01:59:17.186399Z","title":"Alanavlm: A multimodal embodied ai foundation model for egocen- tric video understanding.arXiv preprint arXiv:2406.13807, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:17.186399Z"},"links":{"cited_paper":"/paper/2406.13807","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:8dcad06d2404dfc18f999d781181f34b6e53e74fee1fca59f6383f78926f96d6","observation_id":"8f5c2a54-2c1c-46d1-a50e-8ff3b43a3dcf","resolution":{"observed_at":"2026-08-02T01:59:17.186399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-02T01:59:17.304733Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:17.304733Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:b60f31764b1a8f23ca676cf83625400691da2d8540297ed13f70a1a50b7a6623","observation_id":"58287337-48c1-4af8-bd02-c2ce6333dd5b","resolution":{"observed_at":"2026-08-02T01:59:17.304733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-02T01:59:17.406676Z","title":"Emu3: Next-token prediction is all you need.arXiv preprint arXiv:2409.18869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:17.406676Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:a4e68cf3acc81a85a9ee4aa527d030cfa5e49b1237d50ebc50a09297ddfdb017","observation_id":"be175290-bc13-4f19-a30c-748ab95edd3e","resolution":{"observed_at":"2026-08-02T01:59:17.406676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:17.515648Z","title":"Fastdepth: Fast monocular depth estimation on em- bedded systems","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:17.515648Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:541b0c73540501f8cd9f51fc9da16a79dbf06c3c6e3a1c0884aa095f1855160d","observation_id":"c0f015b3-0808-4241-8a97-b5a6fd790104","resolution":{"observed_at":"2026-08-02T01:59:17.515648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:17.647380Z","title":"Visual question answering: A survey of methods and datasets.Computer Vision and Image Understanding, 163:21–40, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:17.647380Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:2a53564251646ecf304d03f9ca5a903966c987eef72beb57a612dc2862b5377e","observation_id":"029520bc-4b9d-41fb-a7a1-c1ca069ee1b2","resolution":{"observed_at":"2026-08-02T01:59:17.647380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:17.731562Z","title":"Egolife: Towards egocentric life assistant","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:17.731562Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:972267131ba14eb6ef35755e49fb0daf02d51a6d22d1a2cca6c955134943b939","observation_id":"b3001eee-3042-4fda-be0e-89e8fe23942b","resolution":{"observed_at":"2026-08-02T01:59:17.731562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:17.802293Z","title":"Depth anything v2.Advances in Neural Information Processing Systems, 37:21875–21911, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:17.802293Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:e0d59ad413aa3bd50e2240284f8a692f21a231260ea22fa0af29d48d936fb376","observation_id":"a0246b27-dfdb-4ffc-9442-702193a6e75b","resolution":{"observed_at":"2026-08-02T01:59:17.802293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07177","last_updated":"2025-04-13T12:27:56Z","snapshot_observed_at":"2026-07-06T19:30:39.426499Z","submitted_at":"2024-10-09T17:59:59Z","title":"MM-Ego: Towards Building Egocentric Multimodal LLMs for Video QA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07177","snapshot_observed_at":"2026-08-02T01:59:17.934979Z","title":"Mm-ego: Towards building egocentric multimodal llms for video qa","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:17.934979Z"},"links":{"cited_paper":"/paper/2410.07177","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:fb028867a1353ec81a3d555368065f095a3535271838406e812b5e047c5f1ad0","observation_id":"9a8cce54-98b9-488c-ad2a-3b209436c2fe","resolution":{"observed_at":"2026-08-02T01:59:17.934979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:18.058550Z","title":"Metric3d: Towards zero- shot metric 3d prediction from a single image","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:18.058550Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:e4fba9d326949556db9c018c116e6fbcbe5d55fc948db9c8233677873134306e","observation_id":"967597eb-dbee-467e-b868-02cb603a993a","resolution":{"observed_at":"2026-08-02T01:59:18.058550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01502","last_updated":"2022-06-06T08:55:02Z","snapshot_observed_at":"2026-07-06T12:43:31.797959Z","submitted_at":"2022-03-03T03:27:20Z","title":"NeW CRFs: Neural Window Fully-connected CRFs for Monocular Depth Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.01502","snapshot_observed_at":"2026-08-02T01:59:18.177460Z","title":"New crfs: Neural window fully-connected crfs for monocular depth estimation.arXiv preprint arXiv:2203.01502, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:18.177460Z"},"links":{"cited_paper":"/paper/2203.01502","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:73c76f3809269a593200b52550874ab79cadee5672db85ccde732e807d5efae8","observation_id":"857d1fd3-24c7-4d7b-ad72-d2e06c774bbf","resolution":{"observed_at":"2026-08-02T01:59:18.177460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:18.266673Z","title":"Egonight: Towards egocentric vision under- standing at night with a challenging benchmark.arXiv preprint arXiv:2510.06218, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:18.266673Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:5d356a7423715e31a0bb7deecd0e1b3a4070f8d00a3b89bc1cc7f0641a1c74e6","observation_id":"ace98f0a-0237-417a-a0ad-8f059242d5c8","resolution":{"observed_at":"2026-08-02T01:59:18.266673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T01:59:18.334406Z","title":"Egotextvqa: Towards egocentric scene-text aware video question answering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:18.334406Z"},"links":{"citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:d553e1f56d007a1224f5574bcf853d13a5ad8db24438abcd5139728a83bc18a3","observation_id":"9400028d-e145-47f0-830b-fc6eae73cfb5","resolution":{"observed_at":"2026-08-02T01:59:18.334406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20423","last_updated":"2025-08-07T10:14:11Z","snapshot_observed_at":"2026-08-03T11:15:01.136312Z","submitted_at":"2024-12-29T10:13:30Z","title":"ESVQA: Perceptual Quality Assessment of Egocentric Spatial Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20423","snapshot_observed_at":"2026-08-02T01:59:18.438342Z","title":"Unanswerable","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T01:59:18.438342Z"},"links":{"cited_paper":"/paper/2412.20423","citing_paper":"/paper/2607.14497"},"observation_digest":"sha256:3a2e7c17744907baa8f8e71144258e3f26361d9b265743a60e87e7d4dc89f655","observation_id":"d5169957-d4f4-42c6-8280-353bf109e023","resolution":{"observed_at":"2026-08-02T01:59:18.438342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14497","last_updated":"2026-07-16T02:22:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T17:00:27.533897Z","submitted_at":"2026-07-16T02:22:26Z","title":"Reinforcing Egocentric Spatial Perception in Multimodal Large Language Models via Ego Scene Augmentation"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2607.14497."}