{"as_of":"2026-08-09T12:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:21024c6716765d26a6519799cfc239cecb0ae4a8c1c54f0971292ecbd871d51a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:14:29.112728Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:27:15.721443Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.12542","last_updated":"2025-04-23T03:44:01Z","snapshot_observed_at":"2026-08-07T17:00:29.468613Z","submitted_at":"2025-03-16T15:24:11Z","title":"ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos","version":2},"cited_work":{"arxiv_id":"2503.12542","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12542","snapshot_observed_at":"2026-07-02T17:27:15.721443Z","title":"St-think: How multimodal large language models reason about 4d worlds from ego-centric videos","venue":null,"work_id":"5f5f44d9-fdcb-43d4-af54-d127fb0b9bda","year":2025},"citing_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T08:34:36.824053Z"},"links":{"cited_paper":"/paper/2503.12542","citing_paper":"/paper/2505.23747"},"observation_digest":"sha256:105d5d94b0e16bef214fba1f9225487a4007e7441859d994bed150320b50232f","observation_id":"dde903a5-3660-47ac-b6f7-df37b6899a28","resolution":{"observed_at":"2026-05-16T08:34:36.943066Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12542","last_updated":"2025-04-23T03:44:01Z","snapshot_observed_at":"2026-08-07T17:00:29.468613Z","submitted_at":"2025-03-16T15:24:11Z","title":"ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos","version":2},"cited_work":{"arxiv_id":"2503.12542","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12542","snapshot_observed_at":"2026-07-02T17:27:15.721443Z","title":"St-think: How multimodal large language models reason about 4d worlds from ego-centric videos","venue":null,"work_id":"5f5f44d9-fdcb-43d4-af54-d127fb0b9bda","year":2025},"citing_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-22T00:59:13.826054Z"},"links":{"cited_paper":"/paper/2503.12542","citing_paper":"/paper/2505.23747"},"observation_digest":"sha256:3bd7f224affbd922d634a67a6f47f65b1365533cc764e5ca5b3d3e280e6a7a0a","observation_id":"6654a363-dc28-444d-82c0-a699d1dcfae2","resolution":{"observed_at":"2026-05-22T01:00:51.454558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12542","last_updated":"2025-04-23T03:44:01Z","snapshot_observed_at":"2026-08-07T17:00:29.468613Z","submitted_at":"2025-03-16T15:24:11Z","title":"ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12542","snapshot_observed_at":"2026-08-07T11:14:29.112728Z","title":"St-think: How multimodal large language mod- els reason about 4d worlds from ego-centric videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03097","last_updated":"2025-06-03T17:28:00Z","snapshot_observed_at":"2026-08-09T01:06:47.958078Z","submitted_at":"2025-06-03T17:28:00Z","title":"EgoVLM: Policy Optimization for Egocentric Video Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:29.112728Z"},"links":{"cited_paper":"/paper/2503.12542","citing_paper":"/paper/2506.03097"},"observation_digest":"sha256:bb06edd1c905bc307f8b60cdf96547f4fd94f1205a599a3afab69b44e5abd998","observation_id":"7825ea91-ba7e-42fb-a506-0c2806d66248","resolution":{"observed_at":"2026-08-07T11:14:29.112728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12542","last_updated":"2025-04-23T03:44:01Z","snapshot_observed_at":"2026-08-07T17:00:29.468613Z","submitted_at":"2025-03-16T15:24:11Z","title":"ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos","version":2},"cited_work":{"arxiv_id":"2503.12542","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12542","snapshot_observed_at":"2026-07-02T17:27:15.721443Z","title":"St-think: How multimodal large language models reason about 4d worlds from ego-centric videos","venue":null,"work_id":"5f5f44d9-fdcb-43d4-af54-d127fb0b9bda","year":2025},"citing_paper":{"arxiv_id":"2511.21471","last_updated":"2026-05-07T07:59:46Z","snapshot_observed_at":"2026-08-02T23:27:20.204280Z","submitted_at":"2025-11-26T15:04:18Z","title":"SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-17T04:54:59.903644Z"},"links":{"cited_paper":"/paper/2503.12542","citing_paper":"/paper/2511.21471"},"observation_digest":"sha256:46493929bbb539e9bf3d58736f04e6a2bd8ef22d5cddae93c52c795be8d6795c","observation_id":"81f72875-eaac-4ac7-9633-7c3f7746bcc0","resolution":{"observed_at":"2026-05-17T04:59:04.287792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12542","last_updated":"2025-04-23T03:44:01Z","snapshot_observed_at":"2026-08-07T17:00:29.468613Z","submitted_at":"2025-03-16T15:24:11Z","title":"ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos","version":2},"cited_work":{"arxiv_id":"2503.12542","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12542","snapshot_observed_at":"2026-07-02T17:27:15.721443Z","title":"St-think: How multimodal large language models reason about 4d worlds from ego-centric videos","venue":null,"work_id":"5f5f44d9-fdcb-43d4-af54-d127fb0b9bda","year":2025},"citing_paper":{"arxiv_id":"2604.09201","last_updated":"2026-04-10T10:43:18Z","snapshot_observed_at":"2026-07-06T22:58:08.579543Z","submitted_at":"2026-04-10T10:43:18Z","title":"CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T16:53:54.166457Z"},"links":{"cited_paper":"/paper/2503.12542","citing_paper":"/paper/2604.09201"},"observation_digest":"sha256:f8e40fa2b0e81e38c08a3de5ecd30d234e8f8c8c1ade57727ec2adab72f070fe","observation_id":"53e5f12f-4bd8-436b-ac18-5a7cf1b0c975","resolution":{"observed_at":"2026-05-11T07:56:00.403306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12542","last_updated":"2025-04-23T03:44:01Z","snapshot_observed_at":"2026-08-07T17:00:29.468613Z","submitted_at":"2025-03-16T15:24:11Z","title":"ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos","version":2},"cited_work":{"arxiv_id":"2503.12542","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12542","snapshot_observed_at":"2026-07-02T17:27:15.721443Z","title":"St-think: How multimodal large language models reason about 4d worlds from ego-centric videos","venue":null,"work_id":"5f5f44d9-fdcb-43d4-af54-d127fb0b9bda","year":2025},"citing_paper":{"arxiv_id":"2605.10106","last_updated":"2026-05-11T07:20:09Z","snapshot_observed_at":"2026-07-06T23:22:08.560919Z","submitted_at":"2026-05-11T07:20:09Z","title":"ViSRA: A Video-based Spatial Reasoning Agent for Multi-modal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-12T04:00:23.681682Z"},"links":{"cited_paper":"/paper/2503.12542","citing_paper":"/paper/2605.10106"},"observation_digest":"sha256:9d99d3956a77c31af4c3cc1874bccc1064066b81fc9dd51632e96cabd6086359","observation_id":"b2c6297c-2616-41dd-aa8e-d6ede03348d7","resolution":{"observed_at":"2026-05-12T06:46:35.883391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12542","last_updated":"2025-04-23T03:44:01Z","snapshot_observed_at":"2026-08-07T17:00:29.468613Z","submitted_at":"2025-03-16T15:24:11Z","title":"ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos","version":2},"cited_work":{"arxiv_id":"2503.12542","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12542","snapshot_observed_at":"2026-07-02T17:27:15.721443Z","title":"St-think: How multimodal large language models reason about 4d worlds from ego-centric videos","venue":null,"work_id":"5f5f44d9-fdcb-43d4-af54-d127fb0b9bda","year":2025},"citing_paper":{"arxiv_id":"2605.24456","last_updated":"2026-05-26T08:53:56Z","snapshot_observed_at":"2026-07-06T23:34:33.493637Z","submitted_at":"2026-05-23T08:07:45Z","title":"EgoProx: Evaluating MLLMs on Egocentric 3D Proximity Reasoning Across a Cognitive Hierarchy","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-30T13:28:43.538541Z"},"links":{"cited_paper":"/paper/2503.12542","citing_paper":"/paper/2605.24456"},"observation_digest":"sha256:8649efe754a1f6738be180faa3200e7f02e47998d9b64277dbfa91be5322a304","observation_id":"2cb0bb14-a96f-4199-a15b-2cfaab223378","resolution":{"observed_at":"2026-06-30T13:34:40.492377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12542","last_updated":"2025-04-23T03:44:01Z","snapshot_observed_at":"2026-08-07T17:00:29.468613Z","submitted_at":"2025-03-16T15:24:11Z","title":"ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos","version":2},"cited_work":{"arxiv_id":"2503.12542","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12542","snapshot_observed_at":"2026-07-02T17:27:15.721443Z","title":"St-think: How multimodal large language models reason about 4d worlds from ego-centric videos","venue":null,"work_id":"5f5f44d9-fdcb-43d4-af54-d127fb0b9bda","year":2025},"citing_paper":{"arxiv_id":"2606.07433","last_updated":"2026-06-05T16:29:13Z","snapshot_observed_at":"2026-08-01T21:05:06.439607Z","submitted_at":"2026-06-05T16:29:13Z","title":"Watch, Remember, Reason: Human-View Video Understanding with MLLMs","version":1},"reference_index":238,"source":"pdf_text","source_observed_at":"2026-06-27T22:00:28.350003Z"},"links":{"cited_paper":"/paper/2503.12542","citing_paper":"/paper/2606.07433"},"observation_digest":"sha256:a2b9b1a44d4136b69a0f05a3f27640ea0ce61d1eb44de44429e823a3ff8fc2a8","observation_id":"c2728fcc-64a1-4f5c-b8ad-b65e11ea6ebc","resolution":{"observed_at":"2026-07-02T17:27:15.723158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2503.12542/citation-record","integrity":"/paper/2503.12542/integrity","json":"/paper/2503.12542/citation-record.json","paper":"/paper/2503.12542"},"outbound":[],"paper":{"arxiv_id":"2503.12542","last_updated":"2025-04-23T03:44:01Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T17:00:29.468613Z","submitted_at":"2025-03-16T15:24:11Z","title":"ST-Think: How Multimodal Large Language Models Reason About 4D Worlds from Ego-Centric Videos"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2503.12542."}