{"as_of":"2026-08-19T23:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:86e5b743d3496d2b34fa1b9e5243e5da6b2c4be2fd4b330cd010a618ece75aff","coverage":[{"denominator":110,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:32:37.728788Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:08:22.965713Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T00:08:24.618390Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"cited_work":{"arxiv_id":"2411.19141","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.19141","snapshot_observed_at":"2026-08-06T00:08:24.618390Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","venue":"cs.CV","work_id":"4feb1067-0ae5-43db-aca4-c7efc89605c5","year":2024},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:22.965713Z"},"links":{"cited_paper":"/paper/2411.19141","citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:3f6469a37de5b9f6c16bbf7f996df367c9d72b376cf971ce2d1a300c83a7fd73","observation_id":"181391c7-e4c7-4f0e-8e3f-77e358b139b5","resolution":{"observed_at":"2026-08-06T00:08:24.740167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.19141/citation-record","integrity":"/paper/2411.19141/integrity","json":"/paper/2411.19141/citation-record.json","paper":"/paper/2411.19141"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.142791Z","title":"A database and eval- uation methodology for optical flow","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.142791Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:0f08314821d829b630acde852b5d44a4d3ed31e42dda886797026ac38bddfdd6","observation_id":"e354dddc-a16b-42e4-bcca-b6cf9bacedcb","resolution":{"observed_at":"2026-08-12T10:32:37.142791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.148125Z","title":"Multimodal machine learning: A survey and tax- onomy","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.148125Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:d07803ec73e50c3fd5e1e9ae863a6faa7c6aa9a8b0a05e30e205e4d4268aa4ac","observation_id":"01c3951e-38f7-4830-9ebc-1e1c66bffcd5","resolution":{"observed_at":"2026-08-12T10:32:37.148125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.153320Z","title":"Discovering objects that can move","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.153320Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:2f2529f9f8a58c268a072c8c618deb85bf61fced3640f631bd5e917701ae206b","observation_id":"40744b64-0b69-4a9a-8834-06cbb247c495","resolution":{"observed_at":"2026-08-12T10:32:37.153320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15555","last_updated":"2023-03-27T19:14:00Z","snapshot_observed_at":"2026-08-17T13:51:16.457438Z","submitted_at":"2023-03-27T19:14:00Z","title":"Object Discovery from Motion-Guided Tokens","version":1},"cited_work":{"arxiv_id":"2303.15555","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.15555","snapshot_observed_at":"2026-08-12T10:32:38.128564Z","title":"Object Discovery from Motion-Guided Tokens","venue":"cs.CV","work_id":"ca77fd3b-df6d-497f-9332-0e5005d2a976","year":2023},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.158173Z"},"links":{"cited_paper":"/paper/2303.15555","citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:d8919e20a9e09115b7f0ebef1785583060f2d2f3793c99bb104020bc5e2b9b5c","observation_id":"1de58df1-d97d-4373-a042-f96c53d89047","resolution":{"observed_at":"2026-08-12T10:32:38.133504Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.163307Z","title":"It’s moving! a prob- abilistic model for causal motion segmentation in moving camera videos","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.163307Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:9e9540b48ea3b376cbce463563b790327d14d5d04fa45372a6764523c5c032f3","observation_id":"5b5a29ad-c7e7-4593-a359-ba8648b80b1c","resolution":{"observed_at":"2026-08-12T10:32:37.163307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.168114Z","title":"Moa-net: self-supervised motion segmentation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.168114Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:fab3aaaec53b3ab59269d02556ca6913dbcb50f683df19821da9de0e1a39dab0","observation_id":"f4510415-8dac-4aeb-b0b6-920e42714f8d","resolution":{"observed_at":"2026-08-12T10:32:37.168114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.173477Z","title":"The best of both worlds: Combining cnns and geometric constraints for hierarchical motion seg- mentation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.173477Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:e4bfaaca6546de2b9f3c61892edfb2a77609eb1961eb52219cf3f3b105a3e992","observation_id":"4df7e6d2-3c8b-41f3-9578-f68512eb81c9","resolution":{"observed_at":"2026-08-12T10:32:37.173477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.178224Z","title":"Neural-guided ransac: Learning where to sample model hypotheses","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.178224Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:84dcd4c547f247619639e61a0f604fb2fd8e9c9c03823b0a8be02b100117acd0","observation_id":"2c01f469-f3a4-4f58-925c-f06da2dfeb65","resolution":{"observed_at":"2026-08-12T10:32:37.178224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.182669Z","title":"Object segmentation by long term analysis of point trajectories","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.182669Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:042368d5a93717380bb6e929fc8f50ab563b78ff291b39dc744bea3950f78aad","observation_id":"1d9f6e82-ab23-441e-b6d0-582bcd1fa2f2","resolution":{"observed_at":"2026-08-12T10:32:37.182669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.187056Z","title":"A naturalistic open source movie for opti- cal flow evaluation","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.187056Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:420e1ce50e13bbecaa1692d3a87d5d12ed54f2d4245e5a388feed4da34ed8499","observation_id":"05cf7fba-0f1b-4e21-a31d-e000d500f5e4","resolution":{"observed_at":"2026-08-12T10:32:37.187056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.10773","last_updated":"2020-01-29T12:13:20Z","snapshot_observed_at":"2026-07-06T08:53:28.193420Z","submitted_at":"2020-01-29T12:13:20Z","title":"Virtual KITTI 2","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.10773","snapshot_observed_at":"2026-08-12T10:32:37.191663Z","title":"Vir- tual kitti 2","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.191663Z"},"links":{"cited_paper":"/paper/2001.10773","citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:417f16a82e5cc0efe205626d390c9faf7b38e4b0f7af6af8555aa7d8f5a42ae0","observation_id":"c2d42435-3e3a-4148-9930-8d6c528b5982","resolution":{"observed_at":"2026-08-12T10:32:37.191663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.196389Z","title":"End-to- end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.196389Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:aaf36b5261c5856a40bb00e94c293070da38e98546c30e7f09472330ca84a033","observation_id":"294a9137-97d3-474f-9450-4d9bcf7c0659","resolution":{"observed_at":"2026-08-12T10:32:37.196389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-18T18:30:41.010430Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-12T10:32:37.200607Z","title":"Mask2former for video instance segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.200607Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:d53b2ed2ab6aa22f3167958d96f839c114292d32f9880436f7174bec30605cfc","observation_id":"9b7f07e3-187b-4d48-af99-2b7bb02a8ce6","resolution":{"observed_at":"2026-08-12T10:32:37.200607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.205267Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.205267Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:bf9e8d79ed2880e6ff61794569e9319efd172919ff5482c441114031d8851b5c","observation_id":"92acb01c-87c2-47ed-89c1-575190c07513","resolution":{"observed_at":"2026-08-12T10:32:37.205267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.209454Z","title":"Per- pixel classification is not all you need for semantic segmen- tation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.209454Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:ce4916283d81abe4d7c9ddf6b89e298f812a603c5327b1402df75ba1213bff72","observation_id":"62326d37-3af9-4914-a33e-bc3d0e322c3a","resolution":{"observed_at":"2026-08-12T10:32:37.209454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.07844","last_updated":"2022-10-13T18:01:37Z","snapshot_observed_at":"2026-08-18T08:42:49.845205Z","submitted_at":"2022-05-16T17:55:34Z","title":"Guess What Moves: Unsupervised Video and Image Segmentation by Anticipating Motion","version":2},"cited_work":{"arxiv_id":"2205.07844","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.07844","snapshot_observed_at":"2026-08-12T10:32:38.075798Z","title":"Guess What Moves: Unsupervised Video and Image Segmentation by Anticipating Motion","venue":"cs.CV","work_id":"615cd8c5-57c1-48e5-9d15-2c0040016311","year":2022},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.213754Z"},"links":{"cited_paper":"/paper/2205.07844","citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:742400d1dcda20b66a622e15fe39a45c452fd290e5338fa3bd107799d06ab2db","observation_id":"5a6de8cf-bfb5-4af1-b805-d5d20dd4f4a3","resolution":{"observed_at":"2026-08-12T10:32:38.081006Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.218377Z","title":"Robust estimation of a multi-layered motion representation","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.218377Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:959127255ed63b2b966d0b7edb22a0d62d0d078728d2ad159a188a56d860133e","observation_id":"059c4a10-0f66-4db6-85b0-6abdd8af931b","resolution":{"observed_at":"2026-08-12T10:32:37.218377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.222927Z","title":"To- wards segmenting anything that moves","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.222927Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:e136df3fd172895c4932374fdd524f6e9a52568afad41fc8bfd66952ea2163f3","observation_id":"c0ad6966-0444-448c-b2f9-1fec7a59280f","resolution":{"observed_at":"2026-08-12T10:32:37.222927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.228702Z","title":"Fusion- seg: Learning to combine motion and appearance for fully automatic segmentation of generic objects in videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.228702Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:79c82ee2fdaead278666db6fbf3492be8e70b0bff10a7a49fc8b5384c70724eb","observation_id":"81428128-be03-4680-a99a-26ad074920db","resolution":{"observed_at":"2026-08-12T10:32:37.228702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.232966Z","title":"Savi++: Towards end-to-end object-centric learning from real-world videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.232966Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:c8151471dcd8dc9ba50838f382cedbf1fc6cd2a5050f6192dd2a7c827fe93db6","observation_id":"787c6cff-e2c5-47ae-8250-6e1716dbbc41","resolution":{"observed_at":"2026-08-12T10:32:37.232966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.237496Z","title":"Detection free track- ing: Exploiting motion and topology for segmenting and tracking under entanglement","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.237496Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:ffdc58044bf77b6d4861b65b1f638c1a64503c37e07d3ec4d2cc82810a55d73f","observation_id":"b0f5018b-2d87-46b9-949b-65eeb4d2cef7","resolution":{"observed_at":"2026-08-12T10:32:37.237496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.241895Z","title":"Vision meets robotics: The kitti dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.241895Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:d870d2b2d77c8b2e802ecb471f8049746024231a92ed21c537ec6ab98a19fef0","observation_id":"b206cd41-1254-4ec4-bc77-c6d52d6b5e38","resolution":{"observed_at":"2026-08-12T10:32:37.241895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.246321Z","title":"Separate visual pathways for perception and action.Trends in neurosciences, 15(1):20–25, 1992","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.246321Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:0bd71db3c7ccf3aeb499bcee664787dd29bcc9b509ca1424498577dbd9a6eb9f","observation_id":"2304116d-a5a5-49d8-8840-6245210677c1","resolution":{"observed_at":"2026-08-12T10:32:37.246321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.250765Z","title":"In defense of the eight-point algorithm","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.250765Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:7e1ed902a520cb1820792c14a302b6c79a645bafb02e44fc20d2f391f4d8df85","observation_id":"8219b9ad-b8d8-4852-99ec-2cd6be968a83","resolution":{"observed_at":"2026-08-12T10:32:37.250765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.255024Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.255024Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:9e6832819ec3afca6ac2c3c304b8c2412355af70c525cca783d6f26337113467","observation_id":"5c3c8779-0c55-4b82-b84c-6a36544002bc","resolution":{"observed_at":"2026-08-12T10:32:37.255024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.259833Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.259833Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:f50b3fac67b10a75c6cae7152f5b36b27ced24f55043dad9957bff7d0f5d99ef","observation_id":"e0986797-2287-48ac-b24c-d93174abefef","resolution":{"observed_at":"2026-08-12T10:32:37.259833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04403","last_updated":"2022-10-20T12:23:37Z","snapshot_observed_at":"2026-08-16T16:54:13.420730Z","submitted_at":"2022-06-09T10:33:18Z","title":"VITA: Video Instance Segmentation via Object Token Association","version":2},"cited_work":{"arxiv_id":"2206.04403","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.04403","snapshot_observed_at":"2026-08-12T10:32:38.053593Z","title":"VITA: Video Instance Segmentation via Object Token Association","venue":"cs.CV","work_id":"cbeea76b-a965-4335-b51a-26aff8e8e406","year":2022},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.395679Z"},"links":{"cited_paper":"/paper/2206.04403","citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:f4756bde744086c237ec00b6ae42f17a0e829e114eea5f428a67a3a228e87769","observation_id":"8dc1c3ab-b247-4930-a03b-3c08efc866ce","resolution":{"observed_at":"2026-08-12T10:32:38.059323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.400864Z","title":"Detect- ing and tracking multiple moving objects using temporal in- tegration","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.400864Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:1764888fb57d2f2202a53b315d3bef5947b4e5998e0be0abbaf03f9bb1ce2640","observation_id":"73bd43a9-9bde-47a5-b048-833c3e79d9a8","resolution":{"observed_at":"2026-08-12T10:32:37.400864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.05349","last_updated":"2017-04-12T07:36:44Z","snapshot_observed_at":"2026-08-14T21:20:31.363524Z","submitted_at":"2017-01-19T09:48:45Z","title":"Pixel Objectness","version":2},"cited_work":{"arxiv_id":"1701.05349","doi":null,"metadata_source":"pith","pith_arxiv_id":"1701.05349","snapshot_observed_at":"2026-08-12T10:32:38.031537Z","title":"Pixel Objectness","venue":"cs.CV","work_id":"78575d3f-7211-4160-a5b4-952eb974dcc5","year":2017},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.405194Z"},"links":{"cited_paper":"/paper/1701.05349","citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:86b31300ea9f2796844783754c17b011ca84921ce495b94ed53763e37f557271","observation_id":"1ba3e123-40f2-402f-ad18-25f5b9d71b27","resolution":{"observed_at":"2026-08-12T10:32:38.036662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.12148","last_updated":"2022-10-21T17:57:05Z","snapshot_observed_at":"2026-08-16T16:22:09.117865Z","submitted_at":"2022-10-21T17:57:05Z","title":"Unsupervised Multi-object Segmentation by Predicting Probable Motion Patterns","version":1},"cited_work":{"arxiv_id":"2210.12148","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.12148","snapshot_observed_at":"2026-08-12T10:32:38.010660Z","title":"Unsupervised Multi-object Segmentation by Predicting Probable Motion Patterns","venue":"cs.CV","work_id":"4d24f798-e732-4f63-be88-e970c78ecc7c","year":2022},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.409892Z"},"links":{"cited_paper":"/paper/2210.12148","citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:09eddfa66fff7d61bb9c83bb386ee7f069a80532aecac4b6bae7f7fe017d60a4","observation_id":"7072606c-dd25-4839-8f0c-af226f768159","resolution":{"observed_at":"2026-08-12T10:32:38.015594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-12T10:32:37.414395Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.414395Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:ae39e0d9c518a6eda72a85523e162315113794b6324fbd7d4fdd5d5ce01ab670","observation_id":"1012d6ef-9626-48bc-a258-bb67e9c9a1d1","resolution":{"observed_at":"2026-08-12T10:32:37.414395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.419076Z","title":"Ro- bust consistent video depth estimation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.419076Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:73e2ce954a44b31556a2272a94fcf4ab30a29cbfb70f83fda6eaf82f0f222aa2","observation_id":"5ad277c0-7fde-467d-9cac-e655d605b200","resolution":{"observed_at":"2026-08-12T10:32:37.419076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.423534Z","title":"Betrayed by motion: Camouflaged object discovery via motion segmentation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.423534Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:9e1038842035804e8c0d6c91cbf4a0b15d13dcb0704d2c65399a6d8fc50acbfb","observation_id":"fb3be678-0311-49ae-949a-8568a5bf45e8","resolution":{"observed_at":"2026-08-12T10:32:37.423534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.427773Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.427773Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:d840a6d3075ecc8b88f8a64713a204648cf0752bf234d328a5ee1b826d54455d","observation_id":"a8bf3359-b682-455e-9bd8-d01748b99e45","resolution":{"observed_at":"2026-08-12T10:32:37.427773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.432227Z","title":"The emergence of objectness: Learning zero-shot segmentation from videos","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.432227Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:9891a82d242c3b82cd2016c9a3b3f7280d2a503bc94c47d8f7ead5ddf93bc1c4","observation_id":"9c4ee25f-65bd-4288-814a-cc78ad6682dd","resolution":{"observed_at":"2026-08-12T10:32:37.432227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02506","last_updated":"2024-01-18T22:09:40Z","snapshot_observed_at":"2026-08-18T18:36:51.985659Z","submitted_at":"2023-03-04T21:22:47Z","title":"Prismer: A Vision-Language Model with Multi-Task Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02506","snapshot_observed_at":"2026-08-12T10:32:37.436541Z","title":"Prismer: A vision- language model with an ensemble of experts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.436541Z"},"links":{"cited_paper":"/paper/2303.02506","citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:9b6607c64c99390315bcbc64f6a397076215d5c1b9aea97e1faa941a6b931599","observation_id":"d3348d61-3a1d-4fd8-a707-71a788fcb563","resolution":{"observed_at":"2026-08-12T10:32:37.436541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02239","last_updated":"2023-03-21T07:57:46Z","snapshot_observed_at":"2026-08-19T18:49:54.500828Z","submitted_at":"2023-01-05T18:59:51Z","title":"Robust Dynamic Radiance Fields","version":2},"cited_work":{"arxiv_id":"2301.02239","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.02239","snapshot_observed_at":"2026-08-12T10:32:37.959984Z","title":"Robust Dynamic Radiance Fields","venue":"cs.CV","work_id":"77a342c3-66f5-4c35-b97f-26bfedd48b51","year":2023},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.440989Z"},"links":{"cited_paper":"/paper/2301.02239","citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:d75153265ec9cc7a68bc2a77c6b819258b436555b704d7c88cd30501159ff7ef","observation_id":"c5fdf2c6-b715-4eb9-8d76-6a9ca0ae660a","resolution":{"observed_at":"2026-08-12T10:32:37.965404Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T10:32:37.445616Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.445616Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:3b7f9950797f20c19febdf93518efd21ddb5d8badb19ce597f10a7522afc6cc0","observation_id":"b4c68f6b-4172-4f6e-a71c-98044a295fc2","resolution":{"observed_at":"2026-08-12T10:32:37.445616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.450305Z","title":"See more, know more: Unsuper- vised video object segmentation with co-attention siamese networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.450305Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:7346bf4ec0345f84fa44c42ca101ea62be4df2d9bdf1a3d897c0eec07f4c2f3b","observation_id":"4669168a-b781-4465-bae0-243233d85f9a","resolution":{"observed_at":"2026-08-12T10:32:37.450305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.454624Z","title":"Learning rigidity in dynamic scenes with a moving camera for 3d motion field estimation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.454624Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:aa71192466d6b3d5a454a711c300e72350b0b0fa0dbc55830b6e7e9bf823efb1","observation_id":"731f145b-bc72-4022-99a1-7a87429f432c","resolution":{"observed_at":"2026-08-12T10:32:37.454624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.458901Z","title":"A large dataset to train convolutional networks for disparity, optical flow, and scene flow estimation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.458901Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:4ce6e7cd82da1e756b47a9ad6f3c107f5e92743a0c455b65d891e0e9024968ae","observation_id":"b232e6bf-18ec-450e-beeb-75ee47655730","resolution":{"observed_at":"2026-08-12T10:32:37.458901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11422","last_updated":"2021-06-21T21:56:46Z","snapshot_observed_at":"2026-08-16T18:15:30.823365Z","submitted_at":"2021-06-21T21:56:46Z","title":"MODETR: Moving Object Detection with Transformers","version":1},"cited_work":{"arxiv_id":"2106.11422","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.11422","snapshot_observed_at":"2026-08-12T10:32:37.923750Z","title":"MODETR: Moving Object Detection with Transformers","venue":"cs.CV","work_id":"c69e4cc5-0773-4d9d-9a0b-a61671c30ae5","year":2021},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.462995Z"},"links":{"cited_paper":"/paper/2106.11422","citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:6101d53e1fd8cb3b7b7299925c6ae7590ed29b57ffa187a03913b1b83f2c1f33","observation_id":"326a60e8-cb7b-44f8-b508-aa56abee0f06","resolution":{"observed_at":"2026-08-12T10:32:37.930640Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:39.012027Z","title":"Attention bottlenecks for multimodal fusion","venue":null,"work_id":"091c1cab-3d34-4137-8458-a6c93f56924b","year":2021},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.467839Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:79f9ff24e095f09314578e65a2b26756e28e527da7a5667be24e3f96b572a466","observation_id":"453fb021-4299-47bf-8601-a6abdee06304","resolution":{"observed_at":"2026-08-12T10:32:39.016890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.997476Z","title":"Monocular arbitrary moving object discovery and segmentation","venue":null,"work_id":"2048d098-52b1-462e-9cdf-c46962ff3d3f","year":2021},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.472263Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:780909801d7c2fe69d722b89390e6fb4001c7112a200bb593fb50ec129b4d7db","observation_id":"60be7bf1-9ce7-49ab-a293-1b8dbb343198","resolution":{"observed_at":"2026-08-12T10:32:39.002518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.982776Z","title":"Segmenta- tion of moving objects by long term video analysis","venue":null,"work_id":"a180044f-c38a-4642-9236-a4255b4f986c","year":2013},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.476708Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:825e3a680b1816f0032c0455b22d05b8d98344c3da8a15f300e1cdf7ab3c453c","observation_id":"667dd17e-e721-4451-a81a-22d5bfda6a1e","resolution":{"observed_at":"2026-08-12T10:32:38.987641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-12T10:32:37.481185Z","title":"The 2017 davis challenge on video object segmentation.arXiv preprint arXiv:1704.00675, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.481185Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:fd7040e09fc214416557f12aa3b781a0cc81b6fce89ed648b6df918c8d2abaaf","observation_id":"0894bd8e-3972-409a-9951-431aa8745db0","resolution":{"observed_at":"2026-08-12T10:32:37.481185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.966194Z","title":"Vi- sion transformers for dense prediction","venue":null,"work_id":"1545953a-7aae-48dd-b5f4-4d97a1839c87","year":2021},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.485790Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:a93627cd68346870aa22d5848ff6c5d6d7f98235013cce7a453569a844fc2f89","observation_id":"bbc061a1-fe44-4aa9-844f-109a20575e37","resolution":{"observed_at":"2026-08-12T10:32:38.971564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.950169Z","title":"Optical flow estima- tion using a spatial pyramid network","venue":null,"work_id":"424574ad-cef7-435c-bff7-9591d1377002","year":2017},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.490160Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:2f84b96cc865dc2faa5fd92914cbcb8269b9a87f272bb24316367816c7dff1c9","observation_id":"e0662398-37e6-443b-b870-4af49785ad53","resolution":{"observed_at":"2026-08-12T10:32:38.954955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.935304Z","title":"Competitive collaboration: Joint unsupervised learning of depth, camera motion, optical flow and motion segmentation","venue":null,"work_id":"a0e44f19-7777-4861-88a5-9a491bc6670c","year":2019},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.494414Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:288b0ee92f380dbe21bb326875f8c1c235379bada24281826460bdc7cf22d548","observation_id":"ca6fcb5c-c782-40d5-8432-de05571f9a15","resolution":{"observed_at":"2026-08-12T10:32:38.940187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.920843Z","title":"Imagenet large scale visual recognition challenge","venue":null,"work_id":"4889f1e2-0887-4d89-a8e8-fac2c82bbdef","year":2015},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.498649Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:78da79105b46b56559b2f727b03f38fccf88b73909821b6b660b3b9186fa0bf7","observation_id":"0ed0ee7b-a9a8-4c0d-bd3b-14b3e403fc70","resolution":{"observed_at":"2026-08-12T10:32:38.925946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.905909Z","title":"3d geometry from planar parallax","venue":null,"work_id":"dd8ca7f9-747b-4279-9ac5-6044aa401265","year":1994},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.503010Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:af4f64b0f88b90461e30c9de5bebf4310b2c7aeadec3674448661e33514d8d66","observation_id":"d901064f-8e2b-487e-a558-5bbf7e3f5ac1","resolution":{"observed_at":"2026-08-12T10:32:38.910835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.891311Z","title":"Motion segmentation and tracking using normalized cuts","venue":null,"work_id":"58b80f0f-998e-48c8-b7cf-8805ffdcb099","year":1998},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.507555Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:6d7558420a5ac7e82c66d86b04859ad30cf43b11ebaab796a7b6968e5a071ba2","observation_id":"de952be5-f0f1-48f7-8bc7-1ffec8bd2a7f","resolution":{"observed_at":"2026-08-12T10:32:38.896045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14065","last_updated":"2022-05-27T15:50:44Z","snapshot_observed_at":"2026-08-18T02:00:46.348744Z","submitted_at":"2022-05-27T15:50:44Z","title":"Simple Unsupervised Object-Centric Learning for Complex and Naturalistic Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14065","snapshot_observed_at":"2026-08-12T10:32:37.511789Z","title":"Simple unsu- pervised object-centric learning for complex and naturalistic videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.511789Z"},"links":{"cited_paper":"/paper/2205.14065","citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:2e011ee9dc241a9d80af230325e4475d0d7ec0d9fcdaca77381f584a29836b03","observation_id":"49bb4a90-6334-4bf3-9182-c425433cc29c","resolution":{"observed_at":"2026-08-12T10:32:37.511789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.516354Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.516354Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:ec2801d9aa3cc292b90431b4fba6fee93e3877613c353e58cef4e86048d415e9","observation_id":"56f366b1-dd1d-48a3-9015-84ebf1be3b7c","resolution":{"observed_at":"2026-08-12T10:32:37.516354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.867972Z","title":"Droid-slam: Deep visual slam for monocular, stereo, and rgb-d cameras","venue":null,"work_id":"899e02a9-f0e8-41c8-a451-dbbfa429c603","year":2021},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.520667Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:816b7ac79fa75efda6eec13ce01bea7be8aacd0357458cf1ba44adcc24223c01","observation_id":"f4652124-1fc7-40fa-bd94-8df28ac5b7d1","resolution":{"observed_at":"2026-08-12T10:32:38.872373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.854648Z","title":"Raft-3d: Scene flow using rigid- motion embeddings","venue":null,"work_id":"1396be8f-d41f-420b-a2e8-91fb64087897","year":2021},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.524861Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:a34d1cf48a2ac12c0d9f0d7da84fca8c1dbeadad359a5ef2dd210b0740909b55","observation_id":"90f85192-4862-4dbc-a517-90124948900f","resolution":{"observed_at":"2026-08-12T10:32:38.859144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.841366Z","title":"Learning video object segmentation with visual memory","venue":null,"work_id":"15c6e35c-7077-4e2e-87cf-574695a21e2c","year":2017},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.528993Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:9a80ea2de1307c68e3c1d90fa231d80da9af6eb816f2be1872e38ce27af86e3f","observation_id":"7ff902b3-a5e3-4566-a9b5-919402460958","resolution":{"observed_at":"2026-08-12T10:32:38.845757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.827821Z","title":"Geometric motion segmentation and model selection","venue":null,"work_id":"9aed9cc1-f69f-4723-96a7-49d88c9454ca","year":1998},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.533735Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:5ab8a96d6ff27e17a9a756fba3a7a3930e6655eb9f40d4f2f7b7a896be13a368","observation_id":"663cfe81-d924-40c1-9afb-de4a6e1a48d4","resolution":{"observed_at":"2026-08-12T10:32:38.832368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.813945Z","title":"The problem of degeneracy in structure and motion recovery from uncalibrated image sequences","venue":null,"work_id":"4ab69858-30e8-4083-acb3-f12df4108597","year":1999},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.538318Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:1d4c4abf63c560cc1230e341cb513db7fd7a35eeaaf5bed77cdb6057c0eda029","observation_id":"f795935e-965c-47a5-a8b9-770d546fc287","resolution":{"observed_at":"2026-08-12T10:32:38.818739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.799411Z","title":"Robust detection of degenerate configurations while estimat- ing the fundamental matrix","venue":null,"work_id":"40b70d6a-fa91-42a0-92fc-45c5de3821a0","year":1998},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.542509Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:fa8d537a9a0928705556a8bec4217893356a91c68b989f7b08c357418943af77","observation_id":"87b559ba-e070-4cab-bab8-434ab81114ce","resolution":{"observed_at":"2026-08-12T10:32:38.804419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.784316Z","title":"A benchmark for the com- parison of 3-d motion segmentation algorithms","venue":null,"work_id":"f5a888c3-4278-4e2d-acac-14e429a5aa39","year":2007},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.546745Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:c1da3fa42a074d98217088359a3de9d26e231a24a9782da886aa6cf4f74359e5","observation_id":"c7c15914-55f3-412d-a7d3-ba8a23bcd663","resolution":{"observed_at":"2026-08-12T10:32:38.789270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.769478Z","title":"Video segmentation via object flow","venue":null,"work_id":"b24588da-25bc-423d-be7b-61ccdb654bdc","year":2016},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.551075Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:2c8daa23d73b68aaa749660243a674aa561621649c6d636c5a2c6bf477c3261e","observation_id":"fb49ff0a-9e39-462e-8a6d-51f3567face7","resolution":{"observed_at":"2026-08-12T10:32:38.774628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.754893Z","title":"Attention is all you need","venue":null,"work_id":"9fbf01a7-444b-4982-abe6-c517eef7543f","year":2017},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.555561Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:fd6357aac018f896d680c506014c9c044678a5f4bc24467e1495c0484fa973f3","observation_id":"0955197d-352d-4cfb-9aac-b82b85f43431","resolution":{"observed_at":"2026-08-12T10:32:38.759667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.739994Z","title":"Motion segmentation with missing data using powerfactorization and gpca","venue":null,"work_id":"255e3857-8fdf-49bb-a320-0df857d95658","year":2004},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.560417Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:f7b85b2f7b78cea05d68261b557e100f49b569367ad260d5fa07ffb325f26fb4","observation_id":"51b7b9bc-2c67-4f3b-8143-79641535d54f","resolution":{"observed_at":"2026-08-12T10:32:38.745486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.724411Z","title":"Optimal segmentation of dynamic scenes from two perspective views","venue":null,"work_id":"c83b89d0-cffc-4f95-bdc7-3bb00c90aa6b","year":2003},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.564825Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:f23b25177c50164407b18c1310a86935094627e61c4be5079f3605811cf5baac","observation_id":"d4e9eef3-01f7-4d47-ab00-e1ec0a37e856","resolution":{"observed_at":"2026-08-12T10:32:38.729275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.07804","last_updated":"2017-04-25T17:30:05Z","snapshot_observed_at":"2026-08-14T21:04:48.325320Z","submitted_at":"2017-04-25T17:30:05Z","title":"SfM-Net: Learning of Structure and Motion from Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.07804","snapshot_observed_at":"2026-08-12T10:32:37.569611Z","title":"Sfm- net: Learning of structure and motion from video","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.569611Z"},"links":{"cited_paper":"/paper/1704.07804","citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:6d21bfb1ca4081673c5781517d019db6bca676c30a6b1e9673ae34ad5332f922","observation_id":"17587c03-9449-44f2-85a8-00fce0059248","resolution":{"observed_at":"2026-08-12T10:32:37.569611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.709921Z","title":"Opti- cal flow in mostly rigid scenes","venue":null,"work_id":"5eb670cc-1b4e-4016-9140-6293bb3bc940","year":2017},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.574764Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:1e3feea8c1d681a34049c950f5e471ea44d10b124c62567f9d8c811df78742e5","observation_id":"3947c5c2-168b-4874-bc04-b64d17a060ed","resolution":{"observed_at":"2026-08-12T10:32:38.714364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.695425Z","title":"Object discovery in videos as foreground motion clustering","venue":null,"work_id":"a805a984-a584-4d41-86a3-fd339912f681","year":2019},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.579153Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:8c4eccb904263237258249e04cd7a41f29ed5c8dfb0c856c9a4e715bc87f67f0","observation_id":"70690591-e70a-4714-8ec3-bb74bfa7121e","resolution":{"observed_at":"2026-08-12T10:32:38.700334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.680843Z","title":"Segment- ing moving objects via an object-centric layered representa- tion","venue":null,"work_id":"5ddae8d5-cb22-4f70-b606-c083342bc5d0","year":null},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.583701Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:b96848c870472c89c266161a9e929c5dd3cbf32b52f77c6852f4e15e4a13797c","observation_id":"10794445-aa19-4c26-9d76-3f81f0735ebd","resolution":{"observed_at":"2026-08-12T10:32:38.685555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05783","last_updated":"2023-07-26T15:42:58Z","snapshot_observed_at":"2026-08-16T16:17:05.987806Z","submitted_at":"2022-11-10T18:59:54Z","title":"Unifying Flow, Stereo and Depth Estimation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05783","snapshot_observed_at":"2026-08-12T10:32:37.588260Z","title":"Unify- ing flow, stereo and depth estimation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.588260Z"},"links":{"cited_paper":"/paper/2211.05783","citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:093d9bf76eec3f72b5727cbe2952f76b27def0fe0ef4c8e54f4f962a7551706d","observation_id":"2d832b65-e46a-4a46-9526-58ff39758aed","resolution":{"observed_at":"2026-08-12T10:32:37.588260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.03327","last_updated":"2018-09-06T04:19:45Z","snapshot_observed_at":"2026-08-14T18:32:23.594089Z","submitted_at":"2018-09-06T04:19:45Z","title":"YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.03327","snapshot_observed_at":"2026-08-12T10:32:37.592880Z","title":"Youtube-vos: A large-scale video object segmentation benchmark","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.592880Z"},"links":{"cited_paper":"/paper/1809.03327","citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:7d7d9a5f9c5c967af7be1d769bf2a55a991111c5bed31ce36c1602822bc28380","observation_id":"47d29376-93dd-43c2-a576-5128796cb89d","resolution":{"observed_at":"2026-08-12T10:32:37.592880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.666623Z","title":"3d rigid mo- tion segmentation with mixed and unknown number of mod- els","venue":null,"work_id":"b98010af-e633-4f84-a53a-aa4036123039","year":2019},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.597731Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:eb1cfcdd4fd182d94e72aef6dda24c6ac81cab211ae0a21adc5194dd7fd9818f","observation_id":"d93c54a1-c045-45cb-95fd-1b2747f9e637","resolution":{"observed_at":"2026-08-12T10:32:38.671433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.651586Z","title":"A general framework for motion segmentation: Independent, articulated, rigid, non- rigid, degenerate and non-degenerate","venue":null,"work_id":"38a69f48-2551-40e8-8c68-48ba4e57aa7e","year":2006},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.602084Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:0099a10f267394ef65014679710fe6cc7b94c803c78331482142378f17f998e3","observation_id":"caa11949-00e0-43ee-ae3f-8aaa5e5315cd","resolution":{"observed_at":"2026-08-12T10:32:38.656961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:37.606704Z","title":"Self-supervised video object segmentation by motion grouping","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.606704Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:e14b60e7e6493702cd7ee49612b5fa1b342d419920deaff735f15915204482cb","observation_id":"befbe4b6-6d95-4136-b4e9-c5d515a44f32","resolution":{"observed_at":"2026-08-12T10:32:37.606704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.628742Z","title":"Upgrading optical flow to 3d scene flow through optical expansion","venue":null,"work_id":"abb38722-bec6-428c-b8be-9566f6ceec24","year":2020},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.611693Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:4ea0c5fe8acb551dd8929aee40a01e569410ce1ec71643a93132cdf1e62c19c4","observation_id":"491035f8-0840-43a1-b254-c9f74fd67a62","resolution":{"observed_at":"2026-08-12T10:32:38.633258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.615136Z","title":"Learning to seg- ment rigid motions from two frames","venue":null,"work_id":"44e4f722-30a8-4908-8ae2-6c8fcc80829d","year":2021},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.616163Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:8df4336dbac518345d0783fb33c3b24ab87dac90e7cdf03e3a917ce859b032fc","observation_id":"8b54f693-ad83-4876-aaba-958415b4cac7","resolution":{"observed_at":"2026-08-12T10:32:38.619415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.602100Z","title":"Video instance seg- mentation","venue":null,"work_id":"f1c634a6-4819-4525-88c1-c467ea10dc32","year":2019},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.620628Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:690e9b930565b1e37c513231b3b7339da7147192a7173f3a08a0df3b22d60e44","observation_id":"8f32864f-66d0-41b4-8361-96d72f9a6108","resolution":{"observed_at":"2026-08-12T10:32:38.606743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.588765Z","title":"Unsupervised moving object detection via contextual information separation","venue":null,"work_id":"d4648be7-aed3-4063-8cf7-6de80573b36d","year":2019},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.625072Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:eb041b79b5e6f9367b6fc284abab6d6782b3b61d987bd2bc0551463510e84bed","observation_id":"46e297c2-0bcb-491e-9bbe-a09c8cd7770d","resolution":{"observed_at":"2026-08-12T10:32:38.593181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.574893Z","title":"Every pixel counts: Unsupervised geometry learn- ing with holistic 3d motion understanding","venue":null,"work_id":"2356f51c-3a7e-46d1-adbb-2ad1002d18fb","year":2018},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.629485Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:56d618c2c3f8e14bd6017b8f133778a6f6228d6cf09fe1b763b4f6855cad7b6f","observation_id":"d3732622-481c-4a93-b9be-2f61be902603","resolution":{"observed_at":"2026-08-12T10:32:38.579696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.559947Z","title":"Detecting motion regions in the presence of a strong parallax from a moving camera by multiview geometric con- straints","venue":null,"work_id":"32d205a1-055b-4d73-9f61-eb260faa5202","year":2007},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.633927Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:b26deb267b4c2ec104da8ea04c2489d24317b8f564fe518a2da395a668032d74","observation_id":"d7110c72-0b88-4274-ac0a-f8ee7351dd17","resolution":{"observed_at":"2026-08-12T10:32:38.565463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.545526Z","title":"Consistent depth of moving objects in video","venue":null,"work_id":"d92a184a-0c7b-409c-8b0e-e877a4fcf460","year":2021},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.638978Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:47acc5d1e6848c80959a9a8621c09bb0292ed05b4ac9e8200a547ee128024fc9","observation_id":"828cc112-0d98-4747-be92-204f526d0fb4","resolution":{"observed_at":"2026-08-12T10:32:38.550890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.531582Z","title":"Particlesfm: Exploiting dense point trajecto- ries for localizing moving cameras in the wild","venue":null,"work_id":"9750207f-be4c-4e79-bff4-96bb7b8d7fa4","year":2022},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.643693Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:1d05896ffe47dbe6a956c0b6f2bae03c26dbc6617956bea4fc4f1946800aef54","observation_id":"63d314c7-3787-4f0d-976d-934cf618654c","resolution":{"observed_at":"2026-08-12T10:32:38.536715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.517701Z","title":"Motion-attentive transition for zero-shot video object segmentation","venue":null,"work_id":"573283d4-a22e-4b93-ac98-e6345b09f1c0","year":2020},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.648390Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:25ca050f68f2af7febba6fbb985b32ac18a90c42bde40a80e33fcc648d8a07f0","observation_id":"6c4644ee-be0c-4de6-83dc-8e9d360c34b0","resolution":{"observed_at":"2026-08-12T10:32:38.522205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-08-13T17:54:01.724774Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-12T10:32:37.653256Z","title":"Deformable detr: Deformable trans- formers for end-to-end object detection","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.653256Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:5e51aaa90d65db677689e60a5795817d717fa32f9807c563f9a8ba2e99e64182","observation_id":"b2bafb5d-b805-4003-b65f-e31e1c95cfdf","resolution":{"observed_at":"2026-08-12T10:32:37.653256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06718","last_updated":"2023-07-11T18:13:14Z","snapshot_observed_at":"2026-08-16T15:40:37.274062Z","submitted_at":"2023-04-13T17:59:40Z","title":"Segment Everything Everywhere All at Once","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06718","snapshot_observed_at":"2026-08-12T10:32:37.658180Z","title":"Segment everything every- where all at once","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.658180Z"},"links":{"cited_paper":"/paper/2304.06718","citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:4035e265ff7f2f5df833a6da2223270b2580400a6e184b58b18d4f37156e9448","observation_id":"d04424b4-f706-4b9d-bbb7-ed537bcff581","resolution":{"observed_at":"2026-08-12T10:32:37.658180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.502960Z","title":"Placement in the Literature There is a vast amount of related literature on segmen- tation, motion segmentation, moving object discovery and unsupervised feature learning","venue":null,"work_id":"bdd47fd7-8608-41e0-addf-ff153b89c366","year":null},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.662757Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:82c249384dd11cceeb4c8104b34e343f5643453d84160f3eb97e7716cfc89c14","observation_id":"0cf664ad-289c-44fc-a78d-59a72743a2a5","resolution":{"observed_at":"2026-08-12T10:32:38.508241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.489203Z","title":"Training Details We follow a similar training setup as [14]","venue":null,"work_id":"b4087dfc-307d-46cb-bcde-a99d1d174bec","year":null},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.667605Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:5d0afa7fb65b5f3b3e36fe56f681fc112b881e7ca569252cd2a9d95b73dd0700","observation_id":"d9548249-f171-4abb-860e-a7f5cb05c98a","resolution":{"observed_at":"2026-08-12T10:32:38.493872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.475950Z","title":null,"venue":null,"work_id":"ebd9bf7e-7d3d-4752-9dd3-3a5389139d88","year":2016},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.672613Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:b696585ab73ede00d820d526614033e3ce1e61a0bae159b367dfe4166a32e4b8","observation_id":"3b4b67b6-68dc-4237-b696-3565a41d4fcf","resolution":{"observed_at":"2026-08-12T10:32:38.480449Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.461912Z","title":null,"venue":null,"work_id":"878b4414-e447-4ad7-8b41-72c827c556e9","year":2017},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.676858Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:fe9c0d33808d5fde4c6741a7b6918255504086851eeea49c812df390d6bfeb86","observation_id":"3a329901-d827-40b9-b962-841bace319f2","resolution":{"observed_at":"2026-08-12T10:32:38.466293Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.447665Z","title":null,"venue":null,"work_id":"54594c29-df48-432c-ac67-975404c04821","year":2018},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.681172Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:6431b196da1a238ff3007a52aee6425aeeaf2c1d1602e5a1c9b043ad0d1a476f","observation_id":"c4a221c6-01c7-4ca9-ae8b-3db0204987c5","resolution":{"observed_at":"2026-08-12T10:32:38.452180Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.432952Z","title":null,"venue":null,"work_id":"8dbe52b9-4a61-4edd-8391-97a7a7115308","year":2018},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.685770Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:24ceaad3160981ff20935c88100b85ace1d832bcd34a7f07c31df5c5869ced74","observation_id":"2149a768-852a-47e8-8355-dd55b01125d9","resolution":{"observed_at":"2026-08-12T10:32:38.438155Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.416562Z","title":null,"venue":null,"work_id":"6c246649-87a7-4803-9c23-4dd7f888ba7c","year":2018},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.689882Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:15c42291d47aaff214a88e8f31d6c1fee1f0ffd195ecdb3532f7f6b543b1728b","observation_id":"73e2ff9b-786c-41ea-9621-906f7110451f","resolution":{"observed_at":"2026-08-12T10:32:38.422057Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.401070Z","title":null,"venue":null,"work_id":"7efeee37-159a-4a58-bcb6-5088f2c56066","year":2019},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.694273Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:64c4b47bf184e8a36dadd22c7dfee9db9a2552cc25887a9d3a8c2b43a38dc59b","observation_id":"9eb75a08-6152-4326-b995-cb813c4772a8","resolution":{"observed_at":"2026-08-12T10:32:38.406026Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.385500Z","title":null,"venue":null,"work_id":"c623698a-9a5d-44da-91eb-47841fb03e29","year":2019},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.699281Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:2c1dedf23a588a02db9aeddf4eab2570d0c96349056e9f7bcb74e23bc0ad6aad","observation_id":"9f2b9f0b-bc5e-42f2-9e90-16fc32b08080","resolution":{"observed_at":"2026-08-12T10:32:38.391638Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.371827Z","title":null,"venue":null,"work_id":"59e5ff3e-0707-486e-b889-cb5cb6adf003","year":2019},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.703976Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:b6fa45eda29c012009cc6d10c2a80691a14d50bd5d151eb67a69194785b52f70","observation_id":"41e49781-6b8f-4618-99a0-ac18514b6107","resolution":{"observed_at":"2026-08-12T10:32:38.376215Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.357462Z","title":null,"venue":null,"work_id":"a717b989-d7b2-4d8d-95c5-ebd0119d6a91","year":2020},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.708772Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:cd31ae9d4a1e01f08b02d79f3f678d527ce296c93553c84bc7e23f1302600da7","observation_id":"e7752abb-8e95-4f97-9efe-c32e043d97ef","resolution":{"observed_at":"2026-08-12T10:32:38.361981Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.343073Z","title":null,"venue":null,"work_id":"bc2942da-b653-4850-b7b7-6fba4bcf142a","year":2020},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.713852Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:e00dbbcdf796dd78e4067b83501a2d463454f4141c542a8ffccab384a32d26a5","observation_id":"db4cbbb3-54e2-40b5-9e13-f71a2981b475","resolution":{"observed_at":"2026-08-12T10:32:38.347688Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.328582Z","title":null,"venue":null,"work_id":"cfabd6a4-08b5-4793-a179-2a90a42d53bd","year":2021},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.718639Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:197321194920bc99e9dc735126c7ef5859e2d47ff3b0c6b5ecb79497eeebc5e1","observation_id":"18dcf6e8-0af2-43ef-bc16-3e270d956408","resolution":{"observed_at":"2026-08-12T10:32:38.333475Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.313854Z","title":null,"venue":null,"work_id":"b4176230-1558-4702-9501-6ea40e77d568","year":2021},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.723926Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:4c14e5c55dbb29384f00b8b67894121bdb45f921a3d6a591ec89714d15647f8d","observation_id":"becb8f46-0376-42c5-a576-3c10e4a20a37","resolution":{"observed_at":"2026-08-12T10:32:38.319068Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:32:38.300543Z","title":"Costs BS / IS ✗","venue":null,"work_id":"65eca721-e0d9-4120-9f11-38d190dddb58","year":2021},"citing_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-12T10:32:37.728788Z"},"links":{"citing_paper":"/paper/2411.19141"},"observation_digest":"sha256:bbb2e6c250da65063a86ca10963a18760f033952c043da843add2b3efcad9759","observation_id":"3965b985-9825-41fc-97d2-356fbeed0aaf","resolution":{"observed_at":"2026-08-12T10:32:38.304882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":7,"verified_fuzzy":37},"total_outbound_references":110},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 110 outbound references and 1 inbound Pith citation observation for arXiv:2411.19141."}