{"as_of":"2026-08-09T00:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:68800db3cc52ec8764fdaf2605dafba42e9cf573ed5240d86d573c13ba4fa56e","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T15:53:46.081404Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18153/citation-record","integrity":"/paper/2607.18153/integrity","json":"/paper/2607.18153/citation-record.json","paper":"/paper/2607.18153"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:43.151987Z","title":"Motion segmentation and appearance change detection based 2d hand tracking,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:43.151987Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:f0df453788d7ab97b67512ea8e549137539484e51d6db0a69428bfb79926e024","observation_id":"c9070c69-7db0-482e-9984-c886d426b6a1","resolution":{"observed_at":"2026-08-01T15:53:43.151987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:43.212595Z","title":"Moving object segmentation using optical flow and depth information,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:43.212595Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:beaf1df3e809872b0bc8486187d88174c4d100ccf0ece9fe3419b91005dc4d93","observation_id":"2baafe95-d76b-4508-b65a-bce610f1c3c2","resolution":{"observed_at":"2026-08-01T15:53:43.212595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:43.289235Z","title":"Motion and depth augmented semantic segmentation for autonomous navigation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:43.289235Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:83c3dd16bbb6b5bf7bb5848fcbb130ad00060c31427c645c230d6a93521a824e","observation_id":"f407f449-10a4-427a-9570-4a0756e389b7","resolution":{"observed_at":"2026-08-01T15:53:43.289235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:43.418724Z","title":"Dymslam: 4d dynamic scene reconstruction based on geometrical motion segmentation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:43.418724Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:906d0580603de5cc579900804ee68b835bc3b028cb74f731caf4a366de872a7f","observation_id":"933684a2-6321-4da0-b313-7aa6e31d0d30","resolution":{"observed_at":"2026-08-01T15:53:43.418724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:43.497469Z","title":"Particlesfm: Exploiting dense point trajectories for localizing moving cameras in the wild,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:43.497469Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:9d2208f544cf03431ae79bbd4c736526a3ff61002a63ecb33a7f7cbecace58d1","observation_id":"5f4e7f47-771e-4723-a816-b210411b6c46","resolution":{"observed_at":"2026-08-01T15:53:43.497469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:43.699050Z","title":"Leap-vo: Long-term effective any point tracking for visual odometry,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:43.699050Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:5f7dbc893812c734bd664a6fafbed68501c72ae35d185ffdb94163887c8b1f67","observation_id":"e2c27c02-615c-480a-a673-68087ea5d927","resolution":{"observed_at":"2026-08-01T15:53:43.699050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:43.774014Z","title":"Self- supervised video object segmentation by motion grouping,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:43.774014Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:ab3fd2c9ccbcb09f3ea2c64bae18cc9efe434c0537a2f2fd1c8e1748a2b06baa","observation_id":"6ee45166-b7ea-4f98-ac32-00091ffd20ca","resolution":{"observed_at":"2026-08-01T15:53:43.774014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:43.848351Z","title":"Matnet: Motion- attentive transition network for zero-shot video object segmentation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:43.848351Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:8d3fbd31336427a0117a91cf636cbddc35aaef1ccd75ec4fe772f904c7c5ae06","observation_id":"bb803988-f3b3-4b40-975c-42fd1f9fc973","resolution":{"observed_at":"2026-08-01T15:53:43.848351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03825","last_updated":"2025-05-08T08:32:16Z","snapshot_observed_at":"2026-07-06T19:28:08.374354Z","submitted_at":"2024-10-04T18:00:07Z","title":"MonST3R: A Simple Approach for Estimating Geometry in the Presence of Motion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03825","snapshot_observed_at":"2026-08-01T15:53:43.900805Z","title":"Monst3r: A simple approach for estimating geometry in the presence of motion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:43.900805Z"},"links":{"cited_paper":"/paper/2410.03825","citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:58bf0b10bdd84c05dbecd725f5ebb7a2f80a0092f0a29e99ae05bded831d4508","observation_id":"0e8ffaa3-91ea-4981-aea1-9542aff6b0a1","resolution":{"observed_at":"2026-08-01T15:53:43.900805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:43.975363Z","title":"Easi3r: Estimating disentangled motion from dust3r without training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:43.975363Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:62e1c36ba880a4bd20c224713d2e84a5d09fef2a50930f255a17c7ad236b7b24","observation_id":"3a223054-4d0a-4b29-9eef-5a3992c9281f","resolution":{"observed_at":"2026-08-01T15:53:43.975363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19584","last_updated":"2024-12-27T10:59:46Z","snapshot_observed_at":"2026-07-06T20:13:40.548345Z","submitted_at":"2024-12-27T10:59:46Z","title":"DAS3R: Dynamics-Aware Gaussian Splatting for Static Scene Reconstruction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19584","snapshot_observed_at":"2026-08-01T15:53:44.073910Z","title":"Das3r: Dynamics- aware gaussian splatting for static scene reconstruction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:44.073910Z"},"links":{"cited_paper":"/paper/2412.19584","citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:4ea19c6142a934387281e05d87fb7d1b3f8c6e51781fc04a64e2f50c93ef83fb","observation_id":"1d95f863-0cd8-4daa-9314-5134cb0b6ba7","resolution":{"observed_at":"2026-08-01T15:53:44.073910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:44.209244Z","title":"Dynaslam: Tracking, mapping, and inpainting in dynamic scenes,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:44.209244Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:67fb3da48e5301bc0ec184bdc76a27fc9ff648b64cc11fa14112c2b0b07ed648","observation_id":"6597860f-4443-44d2-967d-d7bac343e413","resolution":{"observed_at":"2026-08-01T15:53:44.209244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:44.286519Z","title":"Dynamic-slam: Semantic monocular visual localization and mapping based on deep learning in dynamic environment,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:44.286519Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:a3bcfdb064102892e23f487079bbe4fa6439b1b05d624a09435534705c981f77","observation_id":"3c4ec5c4-0253-4e43-9616-8ccf9593929b","resolution":{"observed_at":"2026-08-01T15:53:44.286519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:44.354959Z","title":"Robust 3d gaussian splatting for novel view synthesis in presence of distractors,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:44.354959Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:31d634f1185f4b64033fffc83441e3540ef8133cc850f0626e0079f603f0de9e","observation_id":"10afc97a-5272-4d14-a228-bc62bdc37a9d","resolution":{"observed_at":"2026-08-01T15:53:44.354959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:44.434346Z","title":"Bootstrapping objectness from videos by relaxed common fate and visual grouping,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:44.434346Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:be79c43b0b956333e6e3892a2bc2cb4d8abc37b0849f10405ef44eee6aac52bb","observation_id":"456be2e8-fa8a-40e5-888b-451c75a12db5","resolution":{"observed_at":"2026-08-01T15:53:44.434346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:44.544399Z","title":"Segmenting moving objects via an object-centric layered representation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:44.544399Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:23d61ccaf86b447c6dfe1aa46f7548e30c58aacc263ec6e2f183e1129a93dea5","observation_id":"7b400d0e-6237-4548-aab7-0a6c920a95f4","resolution":{"observed_at":"2026-08-01T15:53:44.544399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:44.636465Z","title":"Learning segmentation from point trajectories,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:44.636465Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:be4ca3a2a6fb639eb492e15d9cdca1dc1af67f40f393954fe969672160308a82","observation_id":"468a18b9-d951-481a-b886-c71330bc2124","resolution":{"observed_at":"2026-08-01T15:53:44.636465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:44.751946Z","title":"Object segmentation by long term analysis of point trajectories,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:44.751946Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:90a4fcf969090f782b8b65b86086a47c8d3e40923dcb07a1fc1f8f0353a95c0b","observation_id":"632623c8-39d7-4af8-bab5-a2e3caf709f2","resolution":{"observed_at":"2026-08-01T15:53:44.751946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:44.824385Z","title":"Structure and motion from casual videos,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:44.824385Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:9ad0b257f54bd99489a9362c445527f34b068cd7e91bdeee1109c99d0e6abaff","observation_id":"40ddf27a-8ff5-4bcd-89e0-3aba2b36e9db","resolution":{"observed_at":"2026-08-01T15:53:44.824385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18650","last_updated":"2024-11-27T01:09:56Z","snapshot_observed_at":"2026-08-02T18:37:49.450385Z","submitted_at":"2024-11-27T01:09:56Z","title":"RoMo: Robust Motion Segmentation Improves Structure from Motion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18650","snapshot_observed_at":"2026-08-01T15:53:44.925332Z","title":"Romo: Robust motion segmentation improves structure from motion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:44.925332Z"},"links":{"cited_paper":"/paper/2411.18650","citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:d4ebe55ad72f7a37d066d6acd42fa92ff3f47eabd7b4e06c7180fa8d926ae89f","observation_id":"a07a3781-e620-4dac-b2ee-659aba00899f","resolution":{"observed_at":"2026-08-01T15:53:44.925332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:44.995097Z","title":"Fitting conic sections to “very scattered","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:44.995097Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:53b1caffbaf19b47cad8d5d5edcd61bf0f4a9cf3432d2d5aa4317b15eded84da","observation_id":"3f69d61e-889c-488d-acad-347cf4afc955","resolution":{"observed_at":"2026-08-01T15:53:44.995097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-01T15:53:45.076224Z","title":"Sam 2: Segment anything in images and videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:45.076224Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:c4c49e8a6363a7ceddda604245b85515ead753756dd266092f8358124c98f1d2","observation_id":"add22ee1-3f17-4a4e-a12a-b9bfa19e47b8","resolution":{"observed_at":"2026-08-01T15:53:45.076224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:45.174931Z","title":"Dust3r: Geometric 3d vision made easy,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:45.174931Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:15005a3a001a1c623975b86979d5ab876e472eb743b7cab29f749600cc758a8d","observation_id":"cb11dd43-d0e2-4e3e-9786-f2df4a68fa2a","resolution":{"observed_at":"2026-08-01T15:53:45.174931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:45.224851Z","title":"Sea-raft: Simple, efficient, accurate raft for optical flow,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:45.224851Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:a125065bd3562c1a778cfdea36d8509fd2f681ba8f2a0067d304f63fb0f92001","observation_id":"da4475ac-79a0-4894-ba4c-911fee86d77e","resolution":{"observed_at":"2026-08-01T15:53:45.224851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:45.313300Z","title":"Vision transformers for dense prediction,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:45.313300Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:89d5d6c0952877b6cf97af0d0fe77605f65a884a0d6e97e272bb960150eb51a5","observation_id":"2210fd4e-3b3e-4fa3-8c2c-6f38b31a5906","resolution":{"observed_at":"2026-08-01T15:53:45.313300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11831","last_updated":"2024-10-15T17:56:32Z","snapshot_observed_at":"2026-08-03T21:35:04.144048Z","submitted_at":"2024-10-15T17:56:32Z","title":"CoTracker3: Simpler and Better Point Tracking by Pseudo-Labelling Real Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11831","snapshot_observed_at":"2026-08-01T15:53:45.380107Z","title":"Cotracker3: Simpler and better point tracking by pseudo-labelling real videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:45.380107Z"},"links":{"cited_paper":"/paper/2410.11831","citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:d7a3cd9dd21d4fa48361f64685a38983f5cc3fc65660fcc8ecc8f6a216b51d7b","observation_id":"06ad3cc8-e60e-4937-b43e-d0277dd90342","resolution":{"observed_at":"2026-08-01T15:53:45.380107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:45.497719Z","title":"Spars3r: Semantic prior align- ment and regularization for sparse 3d reconstruction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:45.497719Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:6c6fcda67a21d049fc14d06ac53d6d8dff7b6c12934502f6c6902b6c70631696","observation_id":"f10e1b15-5862-43d6-a492-4450b78d6d12","resolution":{"observed_at":"2026-08-01T15:53:45.497719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:45.640880Z","title":"Pointodyssey: A large-scale synthetic dataset for long-term point tracking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:45.640880Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:8971dd03ebc234746e9af050aa62e67d1fce701bd20f2f3a7b438c07b6846359","observation_id":"963b234e-2c77-4841-ad12-ec88eb38828e","resolution":{"observed_at":"2026-08-01T15:53:45.640880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:45.777834Z","title":"A benchmark dataset and evaluation method- ology for video object segmentation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:45.777834Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:5ce13e1df55e8692847144365e975e1ccaab63ffc725f0694c7600b868d580ce","observation_id":"deccfd18-e35e-4206-8d93-20714c5ad31f","resolution":{"observed_at":"2026-08-01T15:53:45.777834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:45.940486Z","title":"A naturalistic open source movie for optical flow evaluation,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:45.940486Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:3df325b5fba5cf12052f70dc63fda2840df3a989280a805921aa535e71845e97","observation_id":"2fe137f3-f40d-4d76-aeba-0efd4acfddb9","resolution":{"observed_at":"2026-08-01T15:53:45.940486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T15:53:46.081404Z","title":"Learning two-view correspondences and geometry using order-aware network,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T15:53:46.081404Z"},"links":{"citing_paper":"/paper/2607.18153"},"observation_digest":"sha256:25cade7d16f6d1196d41c1f7ffb628b285d7f2a4c614cf1d6317897404b85b47","observation_id":"d5625df4-b96c-45c3-892e-91facccb4fdd","resolution":{"observed_at":"2026-08-01T15:53:46.081404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18153","last_updated":"2026-07-20T16:51:48Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T12:11:17.634097Z","submitted_at":"2026-07-20T16:51:48Z","title":"Robust Multimodal Dynamic Object Segmentation"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2607.18153."}