{"as_of":"2026-08-06T06:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:942ac0d6b34a197154431c5f08ef978cbd95d02a788788da92d741106e262f19","coverage":[{"denominator":7,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T13:49:45.095377Z","state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.28132/citation-record","integrity":"/paper/2605.28132/integrity","json":"/paper/2605.28132/citation-record.json","paper":"/paper/2605.28132"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2111.08897","last_updated":"2022-01-12T08:19:29Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-17T04:27:01Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","version":3},"cited_work":{"arxiv_id":"2111.08897","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.08897","snapshot_observed_at":"2026-07-04T06:19:37.435697Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","venue":"cs.CV","work_id":"0ce910be-ca1c-44c7-b7b1-c5353759d85e","year":2021},"citing_paper":{"arxiv_id":"2605.28132","last_updated":"2026-05-27T08:20:04Z","snapshot_observed_at":"2026-07-06T23:37:45.223562Z","submitted_at":"2026-05-27T08:20:04Z","title":"Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T13:49:45.095377Z"},"links":{"cited_paper":"/paper/2111.08897","citing_paper":"/paper/2605.28132"},"observation_digest":"sha256:778aa2ac8c0bc258a6f131803523bc6ded00bbfde8b3f73cbb20cb70df058b2e","observation_id":"9e051b59-4c93-4ba9-a67b-aa501eed1e37","resolution":{"observed_at":"2026-06-29T13:53:28.699603Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.13360","last_updated":"2022-06-20T21:54:36Z","snapshot_observed_at":"2026-07-06T12:33:01.613365Z","submitted_at":"2022-01-31T17:15:41Z","title":"Hydra: A Real-time Spatial Perception System for 3D Scene Graph Construction and Optimization","version":2},"cited_work":{"arxiv_id":"2201.13360","doi":"10.48550/arxiv.2201.13360","metadata_source":"arxiv_reference","pith_arxiv_id":"2201.13360","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hughes, Y","venue":"arXiv (Cornell University)","work_id":"4fae210b-63e4-4568-8d90-2b826b0b309c","year":2022},"citing_paper":{"arxiv_id":"2605.28132","last_updated":"2026-05-27T08:20:04Z","snapshot_observed_at":"2026-07-06T23:37:45.223562Z","submitted_at":"2026-05-27T08:20:04Z","title":"Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T13:49:45.095377Z"},"links":{"cited_paper":"/paper/2201.13360","citing_paper":"/paper/2605.28132"},"observation_digest":"sha256:973dd7bd77e907dce14306b7717656b51aaf3d306f0bbf45d77253be18fd58b3","observation_id":"15ba6a80-e273-4e79-88e6-f2c44a31e0fd","resolution":{"observed_at":"2026-06-29T13:53:28.693772Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.22706","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T22:06:16.940888Z","title":"Iggt: Instance- grounded geometry transformer for semantic 3d reconstruc- tion","venue":null,"work_id":"6e016eeb-2868-4753-b835-22089e21fd18","year":2025},"citing_paper":{"arxiv_id":"2605.28132","last_updated":"2026-05-27T08:20:04Z","snapshot_observed_at":"2026-07-06T23:37:45.223562Z","submitted_at":"2026-05-27T08:20:04Z","title":"Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T13:49:45.095377Z"},"links":{"citing_paper":"/paper/2605.28132"},"observation_digest":"sha256:1925d4ea74f88aae68211c3f500a4028d609af8432102dbcf5b60cf0d83c9623","observation_id":"d6d91e95-174f-4c4e-a0c2-7401bf783f2a","resolution":{"observed_at":"2026-06-29T13:53:28.705111Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.18470","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T11:41:02.583010Z","title":"Pan and H","venue":null,"work_id":"350b6461-07bc-469c-8a06-7ba712d7c0db","year":2025},"citing_paper":{"arxiv_id":"2605.28132","last_updated":"2026-05-27T08:20:04Z","snapshot_observed_at":"2026-07-06T23:37:45.223562Z","submitted_at":"2026-05-27T08:20:04Z","title":"Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T13:49:45.095377Z"},"links":{"citing_paper":"/paper/2605.28132"},"observation_digest":"sha256:22f0b48b8048ea7abc0e26b4a333005692ec3588544fdea13623f0521b75eb68","observation_id":"5050c484-4f37-44b6-9da9-4a3cf203184a","resolution":{"observed_at":"2026-06-29T13:53:28.690788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27792","last_updated":"2026-07-15T07:09:44Z","snapshot_observed_at":"2026-08-02T15:15:08.869109Z","submitted_at":"2026-04-30T12:34:44Z","title":"Motubrain: An Advanced World Action Model for Robot Control","version":5},"cited_work":{"arxiv_id":"2604.27792","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.27792","snapshot_observed_at":"2026-07-09T22:16:36.394978Z","title":"MotuBrain: An Advanced World Action Model for Robot Control","venue":"cs.RO","work_id":"b20ea91b-d63e-47db-8e27-e2dc8e9aa95b","year":2026},"citing_paper":{"arxiv_id":"2605.28132","last_updated":"2026-05-27T08:20:04Z","snapshot_observed_at":"2026-07-06T23:37:45.223562Z","submitted_at":"2026-05-27T08:20:04Z","title":"Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T13:49:45.095377Z"},"links":{"cited_paper":"/paper/2604.27792","citing_paper":"/paper/2605.28132"},"observation_digest":"sha256:caade8c8759217e66b9c1ecab99ce8a3b35b6e6dbfc219c5bec88e0589998591","observation_id":"1dfe407a-545d-44a0-acf5-2c08e0503a44","resolution":{"observed_at":"2026-06-29T13:53:28.702407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-02T11:33:41.662779Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":"2503.09642","doi":"10.48550/arxiv.2503.09642","metadata_source":"pith","pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","venue":"cs.GR","work_id":"c22f9060-268c-4cc9-8018-dee486a23da1","year":2025},"citing_paper":{"arxiv_id":"2605.28132","last_updated":"2026-05-27T08:20:04Z","snapshot_observed_at":"2026-07-06T23:37:45.223562Z","submitted_at":"2026-05-27T08:20:04Z","title":"Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T13:49:45.095377Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2605.28132"},"observation_digest":"sha256:c18e0341dd73a3b46ca1e69c76e5337d4c9a1f7a9a4e36a673c517050f49f793","observation_id":"7a52f2f8-3b1c-4d11-bab1-4db4b4c3222f","resolution":{"observed_at":"2026-06-29T13:53:28.696566Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:49:45.095377Z","title":"VGM features are spatially pooled to a fixed grid when needed: WAN/OpenSora use 15×26 , and CogVideoX/Aether use 15×22 ; VLM features keep their native visual-token grids","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28132","last_updated":"2026-05-27T08:20:04Z","snapshot_observed_at":"2026-07-06T23:37:45.223562Z","submitted_at":"2026-05-27T08:20:04Z","title":"Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T13:49:45.095377Z"},"links":{"citing_paper":"/paper/2605.28132"},"observation_digest":"sha256:29215eeb40eb6ee5f747c2dfc2d98462df97e55530fdab922cd9c15a09d0bc3b","observation_id":"63928e68-38f6-457d-aee4-f807976f477c","resolution":{"observed_at":"2026-06-29T13:49:45.095377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.28132","last_updated":"2026-05-27T08:20:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:37:45.223562Z","submitted_at":"2026-05-27T08:20:04Z","title":"Which Pretraining Paradigm Better Serves Spatial Intelligence? An Empirical Comparison of Vision-Language and Video Generation Models"},"reference_resolution":{"displayed":7,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":1,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":7},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 7 of 7 outbound references and 0 inbound Pith citation observations for arXiv:2605.28132."}