{"as_of":"2026-08-23T00:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a49fffe61bf80c1697281cb3248f5eb002462e237808b3726349c24b0b00b22","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T13:07:07.410877Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.19228/citation-record","integrity":"/paper/2607.19228/integrity","json":"/paper/2607.19228/citation-record.json","paper":"/paper/2607.19228"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:06:59.734822Z","title":"Structure-from-motion revisited","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T13:06:59.734822Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:859794c7a5dea4b36339cca9df57c8e786b53b6c5e69e5ad80803a2cef7762d2","observation_id":"363fb85a-71f3-4757-9c89-b5b5d916388d","resolution":{"observed_at":"2026-08-01T13:06:59.734822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:06:59.843152Z","title":"Pixelwise view selection for unstructured multi-view stereo","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T13:06:59.843152Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:aecab85f6245129746fd1915b224a38dd58591ca58578cd217331dc128480425","observation_id":"78802f69-f562-4dcf-a1fd-f013ea3e799b","resolution":{"observed_at":"2026-08-01T13:06:59.843152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:06:59.942762Z","title":"Orb-slam3: An accurate open-source library for visual, visual–inertial, and multimap slam","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T13:06:59.942762Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:8cc2ce18b78b391e2ad8cd56a0705649033d45d56fb00917ab920cafdd1e93e3","observation_id":"e4813c2c-87bb-42b2-aa5e-055a80c57342","resolution":{"observed_at":"2026-08-01T13:06:59.942762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:00.090115Z","title":"Geoflow-slam: A robust tightly-coupled rgbd-inertial and legged odometry fusion slam for dynamic legged robotics, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:00.090115Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:31206cc80afd71902fbfe87693ce0b09202ec9445db9b75092fdb3f4b07b10fc","observation_id":"04ba12b5-fe14-499c-bf27-fb2bac2443d0","resolution":{"observed_at":"2026-08-01T13:07:00.090115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:00.247315Z","title":"Droid-slam: Deep visual slam for monocular, stereo, and rgb-d cameras.Advances in neural information processing systems, 34:16558–16569, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:00.247315Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:e413f3fb7cbdab4c4ada323e3540d477327c3608167060b9c41ee28fe0fbda75","observation_id":"e04ed4b1-aa66-4daa-94d7-0e7ff5452beb","resolution":{"observed_at":"2026-08-01T13:07:00.247315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:00.404356Z","title":"Nice-slam: Neural implicit scalable encoding for slam","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:00.404356Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:0601996e924d6e27060b2ff873506364197e57596d1f23aa0b55a90ce5386abe","observation_id":"15ac5276-6ee3-423d-926f-6fde823deda5","resolution":{"observed_at":"2026-08-01T13:07:00.404356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:00.517247Z","title":"Iris-slam: Unified geo-instance representations for robust semantic localization and mapping, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:00.517247Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:692ad0a7356107f875048eda5be263b609a26a69311198506010c53665206dc6","observation_id":"594ffbeb-70e0-44af-af5a-b4fd4719341c","resolution":{"observed_at":"2026-08-01T13:07:00.517247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:00.646224Z","title":"Hierarchical open-vocabulary 3d scene graphs for language-grounded robot navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:00.646224Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:ea14f6fc97595ce81378ccbcb02a930556d41ce013b3690c8b9e8b0a38445e5d","observation_id":"a2fca7f4-44a1-4792-83b5-96e780d3c73e","resolution":{"observed_at":"2026-08-01T13:07:00.646224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:00.747007Z","title":"Conceptgraphs: Open-vocabulary 3d scene graphs for perception and planning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:00.747007Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:e34e42d168258e7094d56e37132f78cd8402948c69d1f5ada462526bd6e260e2","observation_id":"c1b7a18f-7951-4ca7-89f6-44da919ffa15","resolution":{"observed_at":"2026-08-01T13:07:00.747007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:00.850400Z","title":"Vggt: Visual geometry grounded transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:00.850400Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:74ee7b863735ee0270b6f84d04484d54ebc118a14a833a03dd97d994a24d521a","observation_id":"2c39b3b8-1c37-412f-9c5a-9bfd1bacd0fe","resolution":{"observed_at":"2026-08-01T13:07:00.850400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.13414","last_updated":"2026-01-23T18:59:33Z","snapshot_observed_at":"2026-08-17T16:28:17.444550Z","submitted_at":"2025-09-16T18:00:14Z","title":"MapAnything: Universal Feed-Forward Metric 3D Reconstruction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.13414","snapshot_observed_at":"2026-08-01T13:07:01.013500Z","title":"Mapanything: Universal feed-forward metric 3d reconstruction.arXiv preprint arXiv:2509.13414, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:01.013500Z"},"links":{"cited_paper":"/paper/2509.13414","citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:c0179fd2341454d7eecad47fd7e81ab1b89a9506561ddf1c0f9614732c71a5a0","observation_id":"a8977b1c-5a80-4349-8838-325729a969e2","resolution":{"observed_at":"2026-08-01T13:07:01.013500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13347","last_updated":"2026-03-07T07:01:59Z","snapshot_observed_at":"2026-08-18T07:52:03.034005Z","submitted_at":"2025-07-17T17:59:53Z","title":"$\\pi^3$: Permutation-Equivariant Visual Geometry Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13347","snapshot_observed_at":"2026-08-01T13:07:01.177240Z","title":"π3: Permutation-equivariant visual geometry learning.arXiv preprint arXiv:2507.13347, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:01.177240Z"},"links":{"cited_paper":"/paper/2507.13347","citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:62de6ff5a439d4cd37f9668ffa869030014472233bc5b7edb56c78e66306cfc2","observation_id":"447e41af-f4b3-4266-a442-bbf1edbe6256","resolution":{"observed_at":"2026-08-01T13:07:01.177240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-08-15T23:16:19.228206Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-01T13:07:01.336995Z","title":"Depth anything 3: Recovering the visual space from any views.arXiv preprint arXiv:2511.10647, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:01.336995Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:107fa2c45e3c4eae21cbc90c3b4faabdd92be126d11782f36dd95b5952a23f33","observation_id":"5c1dc718-283b-4454-98f6-7e77e9d8b40f","resolution":{"observed_at":"2026-08-01T13:07:01.336995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:01.440086Z","title":"3d reconstruction with spatial memory","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:01.440086Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:3a643c3091768c693bbdae22ef82478803d29efb95c67b5e3be8c51e10200b56","observation_id":"fa8e588e-0d7f-439e-a324-be27aec1318c","resolution":{"observed_at":"2026-08-01T13:07:01.440086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:01.565484Z","title":"Continuous 3d perception model with persistent state","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:01.565484Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:0f8f7eaab196373fbff41087776d8f4379237236eef01ef5e0e884205c761b39","observation_id":"21918df0-fd58-4476-b8ba-ca93778fa8d2","resolution":{"observed_at":"2026-08-01T13:07:01.565484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10893","last_updated":"2025-08-14T17:58:05Z","snapshot_observed_at":"2026-08-16T13:34:16.848937Z","submitted_at":"2025-08-14T17:58:05Z","title":"STream3R: Scalable Sequential 3D Reconstruction with Causal Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10893","snapshot_observed_at":"2026-08-01T13:07:01.728160Z","title":"Stream3r: Scalable sequential 3d reconstruction with causal transformer.arXiv preprint arXiv:2508.10893, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:01.728160Z"},"links":{"cited_paper":"/paper/2508.10893","citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:37040d58ab8d613629592f0daf74b6b84afcc366b7f706e2fca8308d52d7549a","observation_id":"42dfe886-a2c8-4eda-a3e7-a6dc05704054","resolution":{"observed_at":"2026-08-01T13:07:01.728160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:01.880244Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:01.880244Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:7f03b7f25ba18da053f3ab1cf3c5102bd04244ecd6742aa60f02b73c88b7b64e","observation_id":"a2aa580a-c922-4928-bdbb-c017079ed2b9","resolution":{"observed_at":"2026-08-01T13:07:01.880244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.03546","last_updated":"2022-04-03T03:33:43Z","snapshot_observed_at":"2026-08-01T06:14:31.660540Z","submitted_at":"2022-01-10T18:59:10Z","title":"Language-driven Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.03546","snapshot_observed_at":"2026-08-01T13:07:01.984196Z","title":"Language- driven semantic segmentation.arXiv preprint arXiv:2201.03546, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:01.984196Z"},"links":{"cited_paper":"/paper/2201.03546","citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:d9d76c0176049a0b7d6f1cf274ad030eaebfa5263b4e5736467478ceb7b93cd3","observation_id":"c974ee24-d77e-46d0-b13c-ed319814960f","resolution":{"observed_at":"2026-08-01T13:07:01.984196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:02.096192Z","title":"Scaling open-vocabulary image segmen- tation with image-level labels","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:02.096192Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:002881bd7d20615b362140f3c25aca38d07449437b4d8896176a600f97f4d013","observation_id":"dae57cca-211f-456c-9dbe-0c1720c5812b","resolution":{"observed_at":"2026-08-01T13:07:02.096192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:02.267579Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:02.267579Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:0e76538b174a98dbdf258d6633be7c84c24a8fb8cb7c4a868b18c206f49d983e","observation_id":"f9036a6d-c941-4d9d-a8aa-26bbacc09da0","resolution":{"observed_at":"2026-08-01T13:07:02.267579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:02.449089Z","title":"Lerf: Language embedded radiance fields","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:02.449089Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:ccea1d066b32826eb7068c6534be2ce8534bc5dcfd459da0c7c463108729ef84","observation_id":"5c674d6d-4cc3-406d-af1b-44a644260558","resolution":{"observed_at":"2026-08-01T13:07:02.449089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:02.562847Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:02.562847Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:6665986320d3512e309c32c60972c94e2a59ef40ae8cc7316b85df401f840d39","observation_id":"47bfa4fe-3a51-4ff0-b215-99d7c2c420c8","resolution":{"observed_at":"2026-08-01T13:07:02.562847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13631","last_updated":"2023-10-29T14:04:25Z","snapshot_observed_at":"2026-08-16T15:21:36.291027Z","submitted_at":"2023-06-23T17:36:44Z","title":"OpenMask3D: Open-Vocabulary 3D Instance Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13631","snapshot_observed_at":"2026-08-01T13:07:02.728959Z","title":"Openmask3d: Open-vocabulary 3d instance segmentation.arXiv preprint arXiv:2306.13631, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:02.728959Z"},"links":{"cited_paper":"/paper/2306.13631","citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:37cc6eed83376198ec2d5146e210ba2001f9509c0cc2768e64880664ef7f8815","observation_id":"ebf8da24-4487-45ad-b5df-7ae38371fcd5","resolution":{"observed_at":"2026-08-01T13:07:02.728959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:02.892402Z","title":"Uni3r: Unified 3d reconstruction and semantic understanding via generalizable gaussian splatting from unposed multi-view images.arXiv preprint arXiv:2508.03643, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:02.892402Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:13969093dc32be03ac31cb453f635ce86944d97db6feb8ed61e107b1d5e714ca","observation_id":"5e6015e3-0896-49c2-a12e-a4f1b6c171a4","resolution":{"observed_at":"2026-08-01T13:07:02.892402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:03.035506Z","title":"Feature 3dgs: Supercharging 3d gaussian splatting to enable distilled feature fields","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:03.035506Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:ce6e95b8b2addb210be2bc4690afdacd1baa2f883aec3fd3fe2e6679c64edf76","observation_id":"054c9eb3-7b3d-4f98-ae5e-ac4c3dfc58cc","resolution":{"observed_at":"2026-08-01T13:07:03.035506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:03.120863Z","title":"3d-llm: Injecting the 3d world into large language models.Advances in Neural Information Processing Systems, 36:20482–20494, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:03.120863Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:9a2d3bc85e3eaf3a967fa808b168ebd908bdca67e06da295d4d978d2a0a9e510","observation_id":"3ac547ea-1775-4ce0-8208-974f38287fb3","resolution":{"observed_at":"2026-08-01T13:07:03.120863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-08-16T13:15:01.097068Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-01T13:07:03.267487Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness.arXiv preprint arXiv:2409.18125, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:03.267487Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:496eb8fc3c4b3210968fe48a0766400b3ffc05ef1cf6f9aac175c176ce380ae6","observation_id":"18e083b6-e336-4298-b764-a396607929ae","resolution":{"observed_at":"2026-08-01T13:07:03.267487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:03.400506Z","title":"Vlm-3r: Vision-language models augmented with instruction-aligned 3d reconstruction, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:03.400506Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:4bf8c14eed8c1b835181d533e64a461055a0c7cfee285b86ddba27c59197b92d","observation_id":"e9d1a42a-270a-42e9-9a4a-04e245dc6aeb","resolution":{"observed_at":"2026-08-01T13:07:03.400506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:03.523210Z","title":"Spa3r: Predictive spatial field modeling for 3d visual reasoning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:03.523210Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:0fd86dc24a2c0ef9992dacb711f20a0081f37ee57cc6de6a7d42eb8185df1c43","observation_id":"bc2d9a2c-8c30-44a1-aaed-632ccc2e52ef","resolution":{"observed_at":"2026-08-01T13:07:03.523210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:03.625301Z","title":"Dust3r: Geometric 3d vision made easy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:03.625301Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:1b89e51460df7cbc893cdcdff930f3ca3a66757f3f28e5c61b8b02c894bc7d93","observation_id":"485c1513-bcea-4690-8c62-518accddeb58","resolution":{"observed_at":"2026-08-01T13:07:03.625301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:03.742137Z","title":"Grounding image matching in 3d with mast3r","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:03.742137Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:17cfeb3e0f39f20d0db410c0db95189976cb1fa7a4002efee66f4c7622e321f3","observation_id":"eb67b233-127b-4f36-99da-177defda0a64","resolution":{"observed_at":"2026-08-01T13:07:03.742137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:03.871545Z","title":"Omnivggt: Omni-modality driven visual geometry grounded transformer.arXiv preprint arXiv:2511.10560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:03.871545Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:ba87baf6f6bdcdc9dae583a689b43049670123c1871d220e86bd873c3356f6d9","observation_id":"2c235ea9-ee15-4791-a381-e929b2450308","resolution":{"observed_at":"2026-08-01T13:07:03.871545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:04.012556Z","title":"Must3r: Multi-view network for stereo 3d reconstruction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:04.012556Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:492dfa7a463f13648fa9dd72ed11933cf82986a90cbcdd465ebfa3ea4d366b79","observation_id":"62365523-0ce5-496a-b402-45684a348f7b","resolution":{"observed_at":"2026-08-01T13:07:04.012556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:04.140414Z","title":"Langsplat: 3d language gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:04.140414Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:b9d8430cdfafe8c53e1813a2bff669fcf97d2bcdcd4b6ae8660a7cd41dc2037f","observation_id":"248c49e5-9383-42ab-98da-2d88009c586e","resolution":{"observed_at":"2026-08-01T13:07:04.140414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:04.257730Z","title":"Langsurf: Language-embedded surface gaussians for 3d scene understanding, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:04.257730Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:237f0f39ca143d29f9296a46cd94fd0f2af5ff3f7000900115c1d847110d5f40","observation_id":"0b136a8d-40d6-4ff1-b93f-72509137d2b0","resolution":{"observed_at":"2026-08-01T13:07:04.257730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:04.398364Z","title":"Large spatial model: End-to-end unposed images to semantic 3d.Advances in neural information processing systems, 37:40212–40229, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:04.398364Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:fa706b893dd7137b1a4083270ee292e711da639573248854bfb425436b1365f2","observation_id":"811b441a-a16d-4709-937e-5a17cb1a680a","resolution":{"observed_at":"2026-08-01T13:07:04.398364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:04.520099Z","title":"Iggt: Instance-grounded geometry transformer for semantic 3d reconstruction.arXiv preprint arXiv:2510.22706, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:04.520099Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:0e2a1223c3d46e2bd345c5035fec8223bf0813f1db2ca1097598617af687db5b","observation_id":"48359b52-62d0-4249-8850-9c1462545361","resolution":{"observed_at":"2026-08-01T13:07:04.520099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:04.617617Z","title":"hdbscan: Hierarchical density based clustering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:04.617617Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:82aa0b2e3752399410c0c702864318e3d835af5b86581a4a34c368c07e80eb64","observation_id":"f4f2b4d0-dcd6-499e-bdf7-ed4426f365d9","resolution":{"observed_at":"2026-08-01T13:07:04.617617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T13:07:04.715508Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:04.715508Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:653adf363501bb92a560c6b099f1fbfc0aa71e099ede2b73784eeef40a0d63b0","observation_id":"2603ae07-36ca-402b-a5b3-0982ab73e5f0","resolution":{"observed_at":"2026-08-01T13:07:04.715508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-01T13:07:04.873133Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:04.873133Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:9ca8f4c0f28e1f9ee481eff73d09a1dafd16ba7c95a19ecd6b80b30dbf08e377","observation_id":"b6c4f932-eedf-4769-b74e-bfe1d7d92356","resolution":{"observed_at":"2026-08-01T13:07:04.873133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.09817","last_updated":"2018-05-24T17:58:02Z","snapshot_observed_at":"2026-08-16T00:52:41.730888Z","submitted_at":"2018-05-24T17:58:02Z","title":"Stereo Magnification: Learning View Synthesis using Multiplane Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.09817","snapshot_observed_at":"2026-08-01T13:07:05.014673Z","title":"Stereo magnifi- cation: Learning view synthesis using multiplane images.arXiv preprint arXiv:1805.09817, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:05.014673Z"},"links":{"cited_paper":"/paper/1805.09817","citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:059204bf376e9d5e75a65547c9b110f54b7d754e45838024a34f40e99dbc2f17","observation_id":"b7bf6900-ad63-4e57-b281-81d3096dd164","resolution":{"observed_at":"2026-08-01T13:07:05.014673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:05.150904Z","title":"Scannet++: A high- fidelity dataset of 3d indoor scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:05.150904Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:90f7fdbdaf56b8d76dc8cc1c4f2595bc7b59290e2888cdd4aff236a5cffe75ee","observation_id":"14562c5b-1fbd-4596-b73c-eb18783c7f0b","resolution":{"observed_at":"2026-08-01T13:07:05.150904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:05.263245Z","title":"Aria digital twin: A new benchmark dataset for egocentric 3d machine perception","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:05.263245Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:a56cc2b180d066d23e2790fbd1c78e7921246489624c6b79ba8a6aa311a8666e","observation_id":"d48c253f-67dd-48a5-b48b-e69cb0b79fd6","resolution":{"observed_at":"2026-08-01T13:07:05.263245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:05.408763Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:05.408763Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:b048ba50f533c7318ff5fb88059b26baf7506b81e196d37b73b19d7e02821560","observation_id":"eee0bb59-c1a8-4bfd-8e21-58695ed10c53","resolution":{"observed_at":"2026-08-01T13:07:05.408763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:05.531618Z","title":"Infinigen indoors: Photorealistic indoor scenes using procedural generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:05.531618Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:a5e955d3529f0fb43e38e325df4eeb6aee79c129242973d0950bb2ee0a63e42d","observation_id":"c1be7905-9387-4f51-ac51-ede1e97829d3","resolution":{"observed_at":"2026-08-01T13:07:05.531618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:05.638584Z","title":"Hypersim: A photorealistic synthetic dataset for holistic indoor scene understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:05.638584Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:86acf2e533f747a011c96a34c282e30ad2e7c0a9eb1c50290a229f84506bcccd","observation_id":"14d9c94d-9992-4352-a04c-5cf14fe0d130","resolution":{"observed_at":"2026-08-01T13:07:05.638584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:05.726812Z","title":"Hoi4d: A 4d egocentric dataset for category-level human-object interaction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:05.726812Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:2e56a5484c47b4be9714c9d40385b74ede2ec88942cdc88daf147f4ee6f3b7ff","observation_id":"3658f25c-1093-41a9-93e4-682adaac0f68","resolution":{"observed_at":"2026-08-01T13:07:05.726812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:05.883052Z","title":"Waymo open dataset: Panoramic video panoptic segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:05.883052Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:70ae0e6608cde14c03f062341cb0bdbf4332b2b977d46ed653c9cb46fe121b92","observation_id":"ec7e9c8f-e1ea-43d7-b3e4-f68ea06e81a6","resolution":{"observed_at":"2026-08-01T13:07:05.883052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-08-01T13:07:06.046534Z","title":"Robotwin 2.0: A scalable data generator and benchmark with strong domain randomization for robust bimanual robotic manipulation.arXiv preprint arXiv:2506.18088, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:06.046534Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:7b3ce9f00868e060d61eed1b340ae8d7d3ecf62cda47346706d43d3af6d4e53b","observation_id":"89fccf2d-61a7-4e0a-8a1b-cb5592f0fbaf","resolution":{"observed_at":"2026-08-01T13:07:06.046534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:06.154363Z","title":"Kubric: A scalable dataset generator","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:06.154363Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:48d36549b98811cbd134aa7776dbacad5f24755edc4443dc7256503f78d48df2","observation_id":"fff17b2e-9f79-49fa-8c69-c6c00293711f","resolution":{"observed_at":"2026-08-01T13:07:06.154363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:06.257727Z","title":"Dynamicstereo: Consistent dynamic depth from stereo videos","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:06.257727Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:320919ad05ebbf9e4ca968a1860ffbacbea3f271e01ab9d32376832995a2a4c3","observation_id":"8cfc85aa-7bba-4666-8aac-f496b69e2776","resolution":{"observed_at":"2026-08-01T13:07:06.257727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:06.367591Z","title":"Pointodyssey: A large-scale synthetic dataset for long-term point tracking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:06.367591Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:edf9ab02ee34adab0dfe6f452e958d1c5689e536cdd6f0f62c4b1be51b198bd9","observation_id":"6ba14669-b584-4c04-af20-723d64adf759","resolution":{"observed_at":"2026-08-01T13:07:06.367591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.10773","last_updated":"2020-01-29T12:13:20Z","snapshot_observed_at":"2026-07-06T08:53:28.193420Z","submitted_at":"2020-01-29T12:13:20Z","title":"Virtual KITTI 2","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.10773","snapshot_observed_at":"2026-08-01T13:07:06.478550Z","title":"Virtual kitti 2.arXiv preprint arXiv:2001.10773, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:06.478550Z"},"links":{"cited_paper":"/paper/2001.10773","citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:514f6cb6cfc7bb852266fb28b95fa9df932e5f2a088085053b647c2a790a024f","observation_id":"b569cd1e-eea5-473c-9f5c-bddf12b81cfe","resolution":{"observed_at":"2026-08-01T13:07:06.478550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:06.656319Z","title":"A volumetric method for building complex models from range images","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:06.656319Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:f479a6f8668da3725fd77e3bf8dce7c6bd7319238f8ee81b4ecb78e7567fe1ea","observation_id":"71a6eb29-f986-4167-a164-b22043d6ef4d","resolution":{"observed_at":"2026-08-01T13:07:06.656319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-01T13:07:06.757917Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:06.757917Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:e9c9b50f484f7c420a6b84cef92c32329785745694bdeb41898393228bd32b92","observation_id":"648f1ab1-c5eb-4e7e-bc39-2668c95e4e62","resolution":{"observed_at":"2026-08-01T13:07:06.757917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:06.885510Z","title":"A multi-view stereo benchmark with high-resolution images and multi-camera videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:06.885510Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:38da258200c5b319f35d10dd85d02caaf8ceeb2062a1a9e1759471db6be10004","observation_id":"08ee0583-fe32-4036-8cea-1b3c0d7c071c","resolution":{"observed_at":"2026-08-01T13:07:06.885510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:07:07.021914Z","title":"Scene coordinate regression forests for camera relocalization in rgb-d images","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:07.021914Z"},"links":{"citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:203a3ffd5d0bddba895d83e3da2b8db9e6fb60b26b16750e5fe5c0825901b554","observation_id":"c6b7c51f-00b1-4746-9781-4b4b200c1a62","resolution":{"observed_at":"2026-08-01T13:07:07.021914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.11539","last_updated":"2026-03-31T10:04:45Z","snapshot_observed_at":"2026-08-21T19:45:07.307576Z","submitted_at":"2025-07-15T17:59:57Z","title":"Streaming 4D Visual Geometry Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11539","snapshot_observed_at":"2026-08-01T13:07:07.127445Z","title":"Streaming 4d visual geometry transformer.arXiv preprint arXiv:2507.11539, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:07.127445Z"},"links":{"cited_paper":"/paper/2507.11539","citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:88e6228e74da20a85a3e245537c9c234a701d26bda7f770178aef3c46da45c21","observation_id":"b3899d2e-a972-4be8-9b19-8729e0ffa48a","resolution":{"observed_at":"2026-08-01T13:07:07.127445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.05296","last_updated":"2025-09-05T17:59:47Z","snapshot_observed_at":"2026-08-17T11:17:54.261626Z","submitted_at":"2025-09-05T17:59:47Z","title":"WinT3R: Window-Based Streaming Reconstruction with Camera Token Pool","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.05296","snapshot_observed_at":"2026-08-01T13:07:07.231951Z","title":"Wint3r: Window-based streaming reconstruction with camera token pool.arXiv preprint arXiv:2509.05296, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:07.231951Z"},"links":{"cited_paper":"/paper/2509.05296","citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:36443b76a7a4f0f3d44c07d1d8bb1151f0c91ed966ae5bd20ca6d306978ed4b1","observation_id":"d2f8b45b-8f2f-4032-9e8b-823ae91c54e0","resolution":{"observed_at":"2026-08-01T13:07:07.231951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14141","last_updated":"2026-04-16T16:44:56Z","snapshot_observed_at":"2026-08-11T14:11:51.712541Z","submitted_at":"2026-04-15T17:58:13Z","title":"Geometric Context Transformer for Streaming 3D Reconstruction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14141","snapshot_observed_at":"2026-08-01T13:07:07.298312Z","title":"Geometric context transformer for streaming 3d reconstruction.arXiv preprint arXiv:2604.14141, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:07.298312Z"},"links":{"cited_paper":"/paper/2604.14141","citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:d0a9796d886a99c6c8dedcac9a291e2191939bf3d86c7ea2c8f69d45f83ca1aa","observation_id":"ead7adfa-cd99-40d0-af7d-67c21abb7d98","resolution":{"observed_at":"2026-08-01T13:07:07.298312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12462","last_updated":"2025-07-19T02:07:12Z","snapshot_observed_at":"2026-08-08T08:02:10.460729Z","submitted_at":"2025-07-16T17:59:03Z","title":"SpatialTrackerV2: 3D Point Tracking Made Easy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12462","snapshot_observed_at":"2026-08-01T13:07:07.410877Z","title":"Spatialtrackerv2: 3d point tracking made easy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T13:07:07.410877Z"},"links":{"cited_paper":"/paper/2507.12462","citing_paper":"/paper/2607.19228"},"observation_digest":"sha256:3af775fff742249afab279487303e067df11d6a0bffd14e5168eb0b4de897827","observation_id":"783e7872-5052-414e-8c07-d1ef26266ade","resolution":{"observed_at":"2026-08-01T13:07:07.410877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.19228","last_updated":"2026-07-21T16:00:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T00:35:58.498477Z","submitted_at":"2026-07-21T16:00:01Z","title":"IGGT4D: Streaming 4D Instance-Grounded Geometry Transformer"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2607.19228."}