{"as_of":"2026-08-21T04:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:956af652e01f23f254770c1940cc31b3c75381d0a582e4b2ef4f6c8bb7b3d252","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.07230/citation-record","integrity":"/paper/2607.07230/integrity","json":"/paper/2607.07230/citation-record.json","paper":"/paper/2607.07230"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.16431","last_updated":"2024-08-29T10:47:17Z","snapshot_observed_at":"2026-08-19T17:36:24.590473Z","submitted_at":"2024-08-29T10:47:17Z","title":"Discriminative Spatial-Semantic VOS Solution: 1st Place Solution for 6th LSVOS","version":1},"cited_work":{"arxiv_id":"2408.16431","doi":"10.48550/arxiv.2408.16431","metadata_source":"pith","pith_arxiv_id":"2408.16431","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Discriminative Spatial-Semantic VOS Solution: 1st Place Solution for 6th LSVOS","venue":"cs.CV","work_id":"ccd37945-8879-4f2b-b8b2-0edd67e3f947","year":2024},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"cited_paper":"/paper/2408.16431","citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:b20fa20914facc55a983778e461ce120607ca23793d979054020a4045cb6c7e9","observation_id":"fdf22ef2-331c-452d-8fe8-9b37bc8f6449","resolution":{"observed_at":"2026-07-09T16:56:21.574646Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr.2016.85","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (2016)","venue":null,"work_id":"53ac48af-82ce-4ade-8d37-8cc6beef2501","year":2016},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:03eccacce310d82e1f28a1f19f95c0fe9c63060fd34a5d6021ddae7273314e31","observation_id":"b875b6f9-7a4b-402f-91ec-853ab6905681","resolution":{"observed_at":"2026-07-09T16:56:21.486824Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-01228-1_36","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2018 , isbn =","venue":"Lecture notes in computer science","work_id":"90d83e14-fadc-48d1-83f4-73ef58b2648c","year":2018},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:fedcb3d06c9a3175dd1e16a1da87627daea9df0824a3442895b9f8e23b5b8013","observation_id":"f88421ef-8b05-4c5e-829c-942a82c5e471","resolution":{"observed_at":"2026-07-09T16:56:21.602672Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-05-23T09:53:46.532066+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T09:53:46.532066+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2018.283867","doi":"10.1109/tnnls.2018.2838679","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence (2018) https://doi.org/10.1109/TPAMI.2018.2838670","venue":"IEEE Transactions on Neural Networks and Learning Systems","work_id":"755e6c05-c749-4862-a303-d9666c7dad12","year":2018},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:87521606393455cb86024faf7d6b5929b175b5e51c5d12aadfd5e8b41184f86a","observation_id":"81cfc05b-8c38-46f9-b790-e9fe09551507","resolution":{"observed_at":"2026-07-09T16:56:21.535495Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00875","last_updated":"2019-07-27T22:59:37Z","snapshot_observed_at":"2026-08-14T16:38:04.240511Z","submitted_at":"2019-05-02T17:45:16Z","title":"Self-supervised Learning for Video Correspondence Flow","version":5},"cited_work":{"arxiv_id":"1905.00875","doi":"10.48550/arxiv.1905.00875","metadata_source":"pith","pith_arxiv_id":"1905.00875","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Self-supervised Learning for Video Correspondence Flow","venue":"cs.CV","work_id":"716d3543-bd5d-4616-9f59-30a7f115cc54","year":2019},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"cited_paper":"/paper/1905.00875","citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:cd9c11386efbe8f3db459041f5532a3cc7e98ccde08e1c2aa9707b21a3858970","observation_id":"5cd6b256-8dc2-4a7d-ad82-62f57b6643ff","resolution":{"observed_at":"2026-07-09T16:56:21.584937Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-01261-8_24","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the European Conference on Computer Vision (2018)","venue":"Lecture notes in computer science","work_id":"c5e3f937-4da2-45a3-a531-6576283dad82","year":2018},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:b2b7dc796350865419ab5fac402b43520f3cb17b2deeafc9c7f37fd02d495919","observation_id":"bf62434f-1c97-4f95-8551-1cded25be817","resolution":{"observed_at":"2026-07-09T16:56:21.593814Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1070.2023","doi":"10.1109/iccv51070.2023","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: 2023 IEEE/CVF International Conference on Computer Vision (ICCV)","venue":null,"work_id":"b8a8bb9e-1d31-40e2-9cab-ae21e338dde6","year":2023},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:c057198079752a51fb50c7ddc3def4cf06bb27956b74026a62c8e6aa53a29d88","observation_id":"a8864982-a5e4-4492-bfb4-5c0a1aac53cb","resolution":{"observed_at":"2026-07-09T16:56:21.626114Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:34.217176+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:34.217176+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr.2019","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.506667Z","title":"Generating 3d adversarial point clouds, in: 2019 IEEE/CVF Conference on Computer Vision and PatternRecognition(CVPR)","venue":null,"work_id":"d45c31f9-450d-4933-a55e-dc648dca8728","year":2019},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:aabc5596effeae24bb694ff3aeca093bc93f4c29e54806bfd3f6df53c2e66abd","observation_id":"c3f69691-3542-4fca-820d-53e4322cb1c2","resolution":{"observed_at":"2026-07-09T16:56:21.508261Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-12T16:19:38.131352+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T16:19:38.131352+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-58558-7_20","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence (2021) https://doi.org/10.1007/978-3-030-58558-7_20","venue":"Lecture notes in computer science","work_id":"14bf2c58-ca64-4193-8ad6-678039351a06","year":2021},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:5f7d062d2d69b4462b305119f208445b6f54a34169f5894300b250bad06f4f44","observation_id":"b328de02-fd78-4e33-a7d8-3304dd39f92f","resolution":{"observed_at":"2026-07-09T16:56:21.591892Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr52734","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.554626Z","title":"Lifting the veil on visual information flow in mllms: Unlocking pathways to faster inference","venue":null,"work_id":"f07730f8-a754-45f3-a4b9-1c9a68e55468","year":2025},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:af19ab866153e7be18b82bdc66165a9f6dc1d84ffb8c6f874c75d737573c89fa","observation_id":"e3a09dec-36de-4fcd-a52e-e408cfd8c67d","resolution":{"observed_at":"2026-07-09T16:56:21.556324Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:50:14.45635+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:50:14.45635+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13974","last_updated":"2023-07-26T06:19:46Z","snapshot_observed_at":"2026-08-16T15:13:13.928363Z","submitted_at":"2023-07-26T06:19:46Z","title":"Tracking Anything in High Quality","version":1},"cited_work":{"arxiv_id":"2307.13974","doi":"10.48550/arxiv.2307.13974","metadata_source":"pith","pith_arxiv_id":"2307.13974","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Tracking Anything in High Quality","venue":"cs.CV","work_id":"ae3df881-648c-4dbf-a774-a3d51b49f8af","year":2023},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"cited_paper":"/paper/2307.13974","citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:86b3eb7c0f89279866aca31a61e5c43105b98bbee1ed25d0fb7d19680f4c3f58","observation_id":"e70e7e67-14be-4670-be45-cb7d0a27531b","resolution":{"observed_at":"2026-07-09T16:56:21.536871Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2688.2022","doi":"10.1109/cvpr52688.2022","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A ConvNet for the 2020s","venue":null,"work_id":"0a23d1b7-bd56-43cc-8a80-7c43ce994e1e","year":2022},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:343dec25020047b7d35d64350471389d42da4700799a1d19cf57076b45e44bf4","observation_id":"907d8b96-c02d-4f1d-bbe1-3d478b7b0e97","resolution":{"observed_at":"2026-07-09T16:56:21.643419Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-12T17:19:41.038772+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T17:19:41.038772+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-72933-1_1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: European Conference on Computer Vision (2024)","venue":"Lecture notes in computer science","work_id":"adf6d7c0-0f9c-4bbf-9bcf-1256d240331c","year":2024},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:83cef98551ba04f286e05f761a51d99b96ee0128de8be85aafadf2fe058f586d","observation_id":"f0200b1a-fcaa-4078-be86-a229bfc748a0","resolution":{"observed_at":"2026-07-09T16:56:21.607627Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.337419","doi":"10.1109/tip.2024.3374199","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IEEE Transactions on Image Processing (2024) https://doi.org/10.1109/tip.2024.3374199","venue":"IEEE Transactions on Image Processing","work_id":"4d12aaee-0dbe-4797-b962-856ebce17ec1","year":2024},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:09c56b5ea4e7fea183386cc021979a3a427d6c4d92e3d7882a547bb69a38b24d","observation_id":"8256a8cb-d50d-4b12-b570-857d6d918124","resolution":{"observed_at":"2026-07-09T16:56:21.606182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.00096","doi":"10.1109/focs.2019.00096","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"c0ce7de2-b1b4-44e7-90be-eedaf9d5a0c0","year":2019},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:5416523715081085940f25478ed0feafa1b210f126f96e861bc5ba2e4d7505ed","observation_id":"5d75e143-a77c-4b87-9e0d-f962ed4db338","resolution":{"observed_at":"2026-07-09T16:56:21.556077Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-09T11:20:47.446865+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T11:20:47.446865+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2688.2022","doi":"10.1109/cvpr52688.2022","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A ConvNet for the 2020s","venue":null,"work_id":"0a23d1b7-bd56-43cc-8a80-7c43ce994e1e","year":2022},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:54e764b48caf822f2f27b0a4bf96aa0abdf4e2762a691b0004f951f19273da71","observation_id":"41713ba1-224a-4e6b-afd8-bc9e63001f5f","resolution":{"observed_at":"2026-07-09T16:56:21.491512Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-12T17:19:41.038772+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T17:19:41.038772+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.patcog.2009.08.005","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pattern Recognition (2010) https://doi.org/10.1016/j.patcog.2009.08.005","venue":"Pattern Recognition","work_id":"d4e6ff11-d792-4110-91ac-594051b077e8","year":2010},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:5822899335a16f14cf659623d1c32171620796944f7b45892f872bdacefd7592","observation_id":"c23b69ba-ac56-45d7-951b-696254fb931e","resolution":{"observed_at":"2026-07-09T16:56:21.505847Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8922.2021","doi":"10.1109/iccv48922.2021","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Walk in the cloud: Learning curves for point clouds shape analysis, pp","venue":null,"work_id":"3820f598-11b0-45c3-8c99-0079181ac0a7","year":2021},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:307a555a79b98ee77d0153e6998aa52d829c1536a53b56fe26ffac18ea9ef069","observation_id":"fd29b24f-e8c8-4090-a0b6-d5db814a3e71","resolution":{"observed_at":"2026-07-09T16:56:21.566222Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":"2304.02643","doi":"10.1109/iccv51070.2023.00371","metadata_source":"pith","pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Segment Anything","venue":"cs.CV","work_id":"2bbf46ca-720a-45a1-8e9c-10c33fbeada0","year":2023},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:22222e7f9c0d2ceea3bf62120e51a5dafc47470a08a95c50800c9479c9dbad3a","observation_id":"bee0c1af-94d8-4a22-865f-a6adfd235928","resolution":{"observed_at":"2026-07-09T16:56:21.595268Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:58.489975+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:58.489975+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.776752Z","title":"In: European Conference on Computer Vision (2024)","venue":null,"work_id":"20c46c7d-3b4e-4dd6-bf1b-b6dc2d4e4c0e","year":2024},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:fdb20b0f9c36bdf6030e591225709d9d69a962f2a0cbee804abc1f15472d4456","observation_id":"60751fc9-552e-485d-9163-e738abedd0eb","resolution":{"observed_at":"2026-07-09T16:56:21.777941Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.770722Z","title":"In: Proceedings of the European Conference on Computer Vision (2022)","venue":null,"work_id":"874a572d-f7df-4da7-bae4-4d3b428efc3d","year":2022},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:83a50809918bce0f29fbf55ee4745eadefff362812f6640b75657936a6772991","observation_id":"ed9b95bc-6e1c-40d3-802e-198491d2c6b0","resolution":{"observed_at":"2026-07-09T16:56:21.771880Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.786442Z","title":"In: Advances in Neural Information Processing Systems, vol","venue":null,"work_id":"51ac6184-ab6f-4495-8eb2-78b63c5c9fa4","year":2021},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:3a1c528e4bb9f1efeb8092637b306b88a0ff7fdc6994c37368322556b11ebc89","observation_id":"fa998dde-f17b-4cb8-bfc7-bbd7998713fe","resolution":{"observed_at":"2026-07-09T16:56:21.787657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":"1704.00675","doi":"10.48550/arxiv.1704.00675","metadata_source":"pith","pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","venue":"cs.CV","work_id":"e062a88c-5ea8-4ba0-97f0-3aae55fee107","year":2017},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:43846d6945ad9c78fa007eb1456faeff63c8728d537fceaaeaad159035278049","observation_id":"223d81d4-9c50-4642-a085-6ffe206d9d60","resolution":{"observed_at":"2026-07-09T16:56:21.511833Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.299239","doi":"10.1109/tpami.2020.2992393","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IEEE transactions on pattern analysis and machine intelligence (2020) https://doi.org/10.1109/tpami.2020.2992393","venue":"IEEE Transactions on Pattern Analysis and Machine Intelligence","work_id":"c0896123-0a35-45da-b848-82e08632a5f2","year":2020},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:636143b6ee637f40a3478507845212bd2e00e424486d3058fe804dc521cc5f31","observation_id":"a0cd62f6-cd6d-48f4-b115-b443dff827f7","resolution":{"observed_at":"2026-07-09T16:56:21.600706Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-12T22:51:01.901234+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T22:51:01.901234+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.0668","doi":"10.20944/preprints202501.0668.v1","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (2020)","venue":"Preprints.org","work_id":"60ac49e3-39ab-4848-8f02-5bcc055fb8a4","year":2020},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:c2c56967012a7dba06ed274d4053d1099ae314856da4dfec44550a66d4538cba","observation_id":"d281d49e-dcf6-4119-b4e8-b432b8eb62ac","resolution":{"observed_at":"2026-07-09T16:56:21.597727Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.772692Z","title":"In: Advances in Neural Information Processing Systems, vol","venue":null,"work_id":"5856cbab-2d56-4847-be3e-701f3e4ffff9","year":2020},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:41e931a7d88b884cc131ff11408010550ac61b8edde30b954a89b581ebfbb0fe","observation_id":"b522050d-de2b-480e-b3c9-afa71abc3dd7","resolution":{"observed_at":"2026-07-09T16:56:21.773814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6437.2021","doi":"10.1109/cvpr46437.2021.00033","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Derf: Decomposed radiance fields","venue":null,"work_id":"7083a41e-5666-435b-ab26-c753f6490b9a","year":2021},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:c1b664402f4ddbf2db4e8f6771f093e467586937c887b0989ff62a41fb4fb7aa","observation_id":"6495f88c-ef9b-4029-9f78-6799eee6029f","resolution":{"observed_at":"2026-07-09T16:56:21.605467Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6437.2021","doi":"10.1109/cvpr46437.2021.00033","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Derf: Decomposed radiance fields","venue":null,"work_id":"7083a41e-5666-435b-ab26-c753f6490b9a","year":2021},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:96f622473aaa792ed2ac38f5c6034d2a39caf3eb09157af2382a3a008127739d","observation_id":"0a93a138-8357-4cad-9739-c9a7d1d2bd77","resolution":{"observed_at":"2026-07-09T16:56:21.587340Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6437.2021","doi":"10.1109/cvpr46437.2021.00033","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Derf: Decomposed radiance fields","venue":null,"work_id":"7083a41e-5666-435b-ab26-c753f6490b9a","year":2021},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:246c343e0947472a5d41fe5f2d0d283104a4a24b7d35631abc3b1279b988880b","observation_id":"2c1c8b37-2b68-4a17-8e25-a830127145a9","resolution":{"observed_at":"2026-07-09T16:56:21.620230Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.330512","doi":"10.1109/tpami.2023.3305122","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crowley, and Dominique Vaufreydaz","venue":"IEEE Transactions on Pattern Analysis and Machine Intelligence","work_id":"b47213a4-8c93-4512-b314-16c0caf1d5c9","year":2023},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:aff3554f494e4ee7d6d3e20cd1d50da358b5497a0db2e16a22ae2271baa471f9","observation_id":"73e90976-cd44-408c-8618-92428e72ac43","resolution":{"observed_at":"2026-07-09T16:56:21.613028Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14279","last_updated":"2021-09-29T09:01:07Z","snapshot_observed_at":"2026-08-16T17:53:12.658202Z","submitted_at":"2021-09-29T09:01:07Z","title":"Localizing Objects with Self-Supervised Transformers and no Labels","version":1},"cited_work":{"arxiv_id":"2109.14279","doi":"10.5244/c.35.365","metadata_source":"pith","pith_arxiv_id":"2109.14279","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Localizing objects with self-supervised transformers and no labels","venue":"cs.CV","work_id":"6e8522da-fb99-4e02-87de-eb6dd9b1f229","year":2021},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2109.14279","citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:6114bd5241938b78d75a307272af68b3c78799a2d12f091e1c92754fb853796b","observation_id":"caad41a6-e971-4fed-8528-27adf6dc5651","resolution":{"observed_at":"2026-07-09T16:56:21.581066Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-13T12:19:50.021967+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T12:19:50.021967+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2688.2022","doi":"10.1109/cvpr52688.2022","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A ConvNet for the 2020s","venue":null,"work_id":"0a23d1b7-bd56-43cc-8a80-7c43ce994e1e","year":2022},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:7c4dddb335afb05c45a35197c6f0de287e17b7cb063d69aa8d56b61c1d3e8b41","observation_id":"5ec44e32-bca6-4cf7-a62e-bc811162d9df","resolution":{"observed_at":"2026-07-09T16:56:21.582507Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-12T17:19:41.038772+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T17:19:41.038772+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2733.2024","doi":"10.1109/cvpr52733.2024","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emogen: Emotional image content generation with text-to-image diffusion models","venue":null,"work_id":"7efbc2dd-b0f2-4f71-bb1c-d2fcf110d805","year":2024},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:e5cc9e8fc8f98c31f2ccbacf141c2ccce788c17da9edf640b8f5585664fc6bf7","observation_id":"fb853458-2bb2-4cc3-89ad-982384bffc68","resolution":{"observed_at":"2026-07-09T16:56:21.640711Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:26.559218+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:26.559218+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.780481Z","title":"In: Advances in Neural Information Processing Systems, vol","venue":null,"work_id":"26d50b17-1a73-47d8-b1db-35638549937b","year":2021},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:f18013696d149b2380186abf5dc0373bb288e989e15625c6715e48a747a27173","observation_id":"efdfb66d-306e-4623-90bf-bc4f621c6cba","resolution":{"observed_at":"2026-07-09T16:56:21.781641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7190.361412","doi":"10.1145/3577190.3614123","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the 25th International Conference on Multimodal Interaction (2023)","venue":"INTERNATIONAL CONFERENCE ON MULTIMODAL INTERACTION","work_id":"cfe04c6b-da63-4386-b11b-6eb690205f63","year":2023},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:0913a4d3e9f250c4fe228fee7a81adf7fa675a7904f1770694b7ac3ce0f3f6ec","observation_id":"a88c5a2a-688f-4a83-9836-ca696f8a8d82","resolution":{"observed_at":"2026-07-09T16:56:21.568047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-319-46448-0_32","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: European Conference on Computer Vision (2016)","venue":"Lecture notes in computer science","work_id":"4337e828-61a9-4d13-93ef-c883bed6a36a","year":2016},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:f35f2b637581655b10712dccaebb949d69d13f788447789cdab656729f8f1e78","observation_id":"2fb86fad-ae34-447b-b034-6a27668cf650","resolution":{"observed_at":"2026-07-09T16:56:21.614870Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2018.00840","doi":"10.1109/cvpr.2018.00840","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (2018)","venue":null,"work_id":"8857f8da-cae6-4d07-88e0-357b9f71beb8","year":2018},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:cf3760f746eaca5d13307137fb62f515ccffe9a31c5dff3f1d4ba32bd8b377c4","observation_id":"e5fc14c4-47a3-4439-8544-824f0bc28a8c","resolution":{"observed_at":"2026-07-09T16:56:21.561908Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr.2016.18","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (2016)","venue":null,"work_id":"52ed1060-61e7-441d-922b-c6acf66ad607","year":2016},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:4f487b2d0d7f57b2856f28f81a552d30b2d84f3f69bb1c95833deaddfee644fe","observation_id":"edafd96f-9462-4c9b-b66b-5ed13c72807b","resolution":{"observed_at":"2026-07-09T16:56:21.590799Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.784227Z","title":"In: Advances in Neural Information Processing Systems, vol","venue":null,"work_id":"87bb6efb-9ac7-414e-8a0a-ac0282809841","year":2020},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:3435c57b08ba5ab9bdaab408567fe6bf589d7cb514c6a5b045b47a4195f87983","observation_id":"d21d9393-945c-4638-8258-459e25e11a4c","resolution":{"observed_at":"2026-07-09T16:56:21.785591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.779458Z","title":"In: Advances in Neural Information Processing Systems, vol","venue":null,"work_id":"ba2a917e-4cdb-47ac-a744-3ab75308c13d","year":2020},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:abbd868586aaa1a21901d2e8dd3a3fe86c8adb9255ab04d5841ab3a5e3774c10","observation_id":"24992af4-98d6-42db-8115-0a8b4c1b9d2c","resolution":{"observed_at":"2026-07-09T16:56:21.780846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2600.2020","doi":"10.1109/cvpr42600.2020.000154","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer 25 Vision and Pattern Recognition, pp","venue":null,"work_id":"9da51225-b7bd-4032-b7db-ca577971dafe","year":2020},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:e847c52cf108bd0cc761c863efdbe1733c92da918d6fdc62c154bbc432ab9bb7","observation_id":"072fe1de-e973-4da9-9a68-66da7c34daf8","resolution":{"observed_at":"2026-07-09T16:56:21.569136Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1070.2023","doi":"10.1109/iccv51070.2023","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: 2023 IEEE/CVF International Conference on Computer Vision (ICCV)","venue":null,"work_id":"b8a8bb9e-1d31-40e2-9cab-ae21e338dde6","year":2023},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:dc532309b70b2f190114b9c8c6fa52f85e0d66f8a613629c9dc95bdc92bdbb05","observation_id":"35cef1d8-a11a-47df-b8dd-f89086fa23ad","resolution":{"observed_at":"2026-07-09T16:56:21.516123Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:34.217176+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:34.217176+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05814","last_updated":"2022-10-15T21:18:49Z","snapshot_observed_at":"2026-08-19T20:39:59.358844Z","submitted_at":"2021-12-10T20:15:03Z","title":"Deep ViT Features as Dense Visual Descriptors","version":3},"cited_work":{"arxiv_id":"2112.05814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.05814","snapshot_observed_at":"2026-07-09T16:56:21.644793Z","title":"Deep vit features as dense visual descriptors.arXiv preprint arXiv:2112.05814, 2(3):4","venue":"cs.CV","work_id":"32f5cddf-1446-4477-986d-22ac06fd151f","year":2021},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"cited_paper":"/paper/2112.05814","citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:4aff1c360f4f940c7d0a484ef5e79425a2a11ba1690d8cd9ed0f2639f4136673","observation_id":"90ea3029-786c-4f02-8b36-6e451092037e","resolution":{"observed_at":"2026-07-09T16:56:21.645918Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.792004Z","title":"In: Advances in Neural Information Processing Systems, vol","venue":null,"work_id":"27443345-8e9b-4f19-a7d9-8f069be1f134","year":2022},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:f97221824e1d21e3afd3bcf0dc1c008940c2162eb7d7b743fcbea0d8c78debb2","observation_id":"e58673b7-a271-4a63-8c46-4320efa28c77","resolution":{"observed_at":"2026-07-09T16:56:21.793889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:afaa07e6a41c64ee6efed06d1941b253385486ae66f146bbd96473943e641bf1","observation_id":"579e8556-ce47-4d20-a774-a7a2c791e9b2","resolution":{"observed_at":"2026-07-09T16:56:21.565051Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:b5bef91caf700c44ea05294b30c55237e83d3c9acdc966499fb7ecea049d3d25","observation_id":"06912e84-7694-4e00-a2d4-726d9108d707","resolution":{"observed_at":"2026-07-09T16:56:21.628475Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-73226-3_4","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: European Conference on Computer Vision (2024)","venue":"Lecture notes in computer science","work_id":"2674cc2c-2c72-4367-ba08-0445b8d8c45b","year":2024},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:59e3d83b62e19ea2712ef695b1834c1038622e4c66eef0a4cd6cb2af2941b895","observation_id":"972e41c3-0c6f-48fd-91c5-08eba61eee9b","resolution":{"observed_at":"2026-07-09T16:56:21.544938Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3115.2024","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.636311Z","title":"In: IEEE Conference on Computer Vision and Pattern Recognition (2024)","venue":null,"work_id":"31473470-9c15-4422-bdbc-be666c8f129c","year":2024},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:5027aa39a98d6cfbe3b18464d825617e14519406915985e4016837ff890b2449","observation_id":"2e5396f8-d14e-419e-bd82-78897b3ad943","resolution":{"observed_at":"2026-07-09T16:56:21.637668Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12781","last_updated":"2025-03-17T03:33:36Z","snapshot_observed_at":"2026-08-18T20:34:08.655009Z","submitted_at":"2025-03-17T03:33:36Z","title":"SAM2 for Image and Video Segmentation: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2503.12781","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.12781","snapshot_observed_at":"2026-07-09T16:56:21.561846Z","title":"SAM2 for image and video segmentation: A comprehensive survey.CoRR, abs/2503.12781","venue":"cs.CV","work_id":"6e8cce9b-6644-43f5-bb40-ba1bf5b320a3","year":2025},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"cited_paper":"/paper/2503.12781","citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:527bc3a65cedfa00554f371a977b2c6282b5c1b02a525dc44e9897f130897a5a","observation_id":"63d31953-a281-45f5-8d41-087f8e5bd823","resolution":{"observed_at":"2026-07-09T16:56:21.563362Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.788366Z","title":null,"venue":null,"work_id":"1fa93c51-0e5c-4060-a466-930b8b1618af","year":2021},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:2ab6e43ba734a5881e819046a6c4bd469473ac9c53f217b626d2e5ff1c3d12c2","observation_id":"8965f49b-9c67-4ed8-8fdc-1952d5f4c99c","resolution":{"observed_at":"2026-07-09T16:56:21.789456Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-08-13T04:00:22.647615Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":"2210.09461","doi":"10.48550/arxiv.2210.09461","metadata_source":"pith","pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Token Merging: Your ViT But Faster","venue":"cs.CV","work_id":"528509bc-2611-4e7f-a772-ea14d25b6dae","year":2022},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:893c9219211e2d73482de55c494c1b4cac05f6d973459d58cc9d4bb0e5755426","observation_id":"5779d19d-b8dc-420b-9d88-c56246c7bd86","resolution":{"observed_at":"2026-07-09T16:56:21.572241Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.790308Z","title":"In: Advances in Neural Information Processing Systems, vol","venue":null,"work_id":"1cab457b-9d84-4d1b-96aa-26e57948e174","year":2021},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:ff48e3b6ddb8ba120f51d249a59abd42ce86f4158b06046c1e51d20c67891e28","observation_id":"67b9ff1a-365e-4c09-a43c-ec9e3387f6e8","resolution":{"observed_at":"2026-07-09T16:56:21.791459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1070.2023","doi":"10.1109/iccv51070.2023","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: 2023 IEEE/CVF International Conference on Computer Vision (ICCV)","venue":null,"work_id":"b8a8bb9e-1d31-40e2-9cab-ae21e338dde6","year":2023},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:4b1026458a2ac3f1dde88200b4792fb425bcb7ccb98ce768cfd387aa194adb19","observation_id":"f3180b5c-01e3-414e-8290-13c3cd7a6e96","resolution":{"observed_at":"2026-07-09T16:56:21.552749Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:34.217176+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:34.217176+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.13132","last_updated":"2020-02-19T17:56:41Z","snapshot_observed_at":"2026-08-18T03:03:47.098814Z","submitted_at":"2019-04-30T10:10:38Z","title":"A critical analysis of self-supervision, or what we can learn from a single image","version":3},"cited_work":{"arxiv_id":"1904.13132","doi":"10.48550/arxiv.1904.13132","metadata_source":"pith","pith_arxiv_id":"1904.13132","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M., Rupprecht, C., and Vedaldi, A","venue":"cs.CV","work_id":"c8d2be2c-6212-4a2a-881f-6e3e1b58b1cc","year":2019},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"cited_paper":"/paper/1904.13132","citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:24a9b5421cea8286ca934ccb6ccf924d11e8f671fb51db914dc06f3a7693b8fc","observation_id":"428a6440-e563-4906-b31e-86509157fc84","resolution":{"observed_at":"2026-07-09T16:56:21.608805Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-58542-6_38","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: European Conference on Computer Vision (2020)","venue":"Lecture notes in computer science","work_id":"91186d81-8876-4b19-a4f4-d9ae12b01a0c","year":2020},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:c1dfcda6bb35e8e0e7b7588aaa07fc66c0f35f4267b564a6edc5fa333046590c","observation_id":"b0ee87c6-c50c-46ce-a11b-56fd8f32afec","resolution":{"observed_at":"2026-07-09T16:56:21.603372Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.584097Z","title":"2016.280","venue":null,"work_id":"45b0bfd8-65dc-4252-b2ab-2f6b411d04d0","year":2018},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:76d8c22458ff509bed267f7615c47afeaa1fccf3ad76783924631653c35e108e","observation_id":"56e2b05e-dabe-431e-865c-2b6afed2d75d","resolution":{"observed_at":"2026-07-09T16:56:21.585561Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-01264-9_9","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the European Conference on Computer Vision (2018)","venue":"Lecture notes in computer science","work_id":"4af1f745-717e-4fa8-ad2d-66eecb6a14a9","year":2018},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:f577ae00312f64a2ca0b0210dbec541e7b7594de5c2ad9f869147973704cfae2","observation_id":"0405e574-2a7e-4b07-a8da-a0206050de37","resolution":{"observed_at":"2026-07-09T16:56:21.572067Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.00996","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.621466Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision (2019)","venue":null,"work_id":"d08816ff-c4a8-471c-aa87-e6ac914ffa9a","year":2019},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:095b972359caa1c53df056c683f6643b65f31c953188eca3a481d43977b29ee1","observation_id":"5002a8c2-3a3c-4595-9d80-2e1058caa09e","resolution":{"observed_at":"2026-07-09T16:56:21.622970Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.781387Z","title":"In: Advances in Neural Information Processing Systems, vol","venue":null,"work_id":"b3e65e46-e794-42fd-8b73-325566dae5c4","year":2020},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:c568f72ea06547e4fd358afdc15a41640817d6206df7e879bf8de4ad15654d61","observation_id":"ae156c9f-00ed-46ec-8bee-8a2967c3d44e","resolution":{"observed_at":"2026-07-09T16:56:21.782675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.00932","doi":"10.1109/iccv.2019.00932","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the IEEE/CVF International ConferenceonComputerVision(2019).https://doi.org/10.1109/iccv.2019.00932","venue":null,"work_id":"671dff82-dd9b-468e-97f5-240cb0f49137","year":2019},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:63374a9be4b0330368735cd752c2359e358cf18fad70b38f3c5f47cabb7470e0","observation_id":"f114484b-6f3c-4f14-8b9e-4954c14d752e","resolution":{"observed_at":"2026-07-09T16:56:21.553337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/075280-1424","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Advances in Neural Information Processing Systems, vol","venue":null,"work_id":"0c56bd32-f4e4-43ae-ab30-55a7f8a95753","year":2023},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:4b821b9ad723f1a17ce7d88f30c03fc0dc6236d5de39a2b682c3f28fffae5884","observation_id":"e11691ff-40d1-4921-979a-2e74ee91fe57","resolution":{"observed_at":"2026-07-09T16:56:21.610354Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/068431-2032","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Advances in Neural Information Processing Systems, vol","venue":null,"work_id":"3bccc626-45bd-4922-9936-7c6c35afa5b0","year":2022},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:8ab34c98ac9daac61501aac063bf279571ffc1d2c754fb296029a5194d14ad8f","observation_id":"d9788f1e-2ac0-4082-ac51-6fd95a41605b","resolution":{"observed_at":"2026-07-09T16:56:21.592930Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1070.2023","doi":"10.1109/iccv51070.2023","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: 2023 IEEE/CVF International Conference on Computer Vision (ICCV)","venue":null,"work_id":"b8a8bb9e-1d31-40e2-9cab-ae21e338dde6","year":2023},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:456878d6ff8e607df6a3dae443e281238d4e7c06ac98815d0634eebee1b876cd","observation_id":"28ad60fd-889e-49c5-b0ba-78f4dd52d7f4","resolution":{"observed_at":"2026-07-09T16:56:21.590028Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:34.217176+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:34.217176+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.302691","doi":"10.1109/tmm.2020.3026913","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IEEE Transactions on Multimedia (2020) https://doi.org/ 10.1109/tmm.2020.3026913","venue":"IEEE Transactions on Multimedia","work_id":"8ab6c146-00e7-499a-90ab-e80cc3816581","year":2020},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:305e7e3bf9b5d70f2dcbcfabbc3a15567707decf5b56e3d141e434d185cb1b18","observation_id":"3013250b-feb6-4d0e-a18b-a65e8bc5d8ec","resolution":{"observed_at":"2026-07-09T16:56:21.617268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2018.00680","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.633093Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (2018)","venue":null,"work_id":"6364ecdd-ab2e-4249-8333-75aeb31a6d50","year":2018},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:46954dfe738065a2a09fdade0f2cdabc38db9c9bb7ba7952689b236b5d5768ad","observation_id":"925144d6-029b-4fbe-8128-8700d0b5744d","resolution":{"observed_at":"2026-07-09T16:56:21.634553Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr.2017.372","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learn- ing video object segmentation from static images","venue":null,"work_id":"c21f3816-6346-44e4-9d37-4f4e13c5b3bc","year":2017},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:2d404da3f92eb024cb618bcf37de31e599033d7aae6e338fc0b427aea583a50c","observation_id":"9a83a6f4-f820-4a8d-8a04-0294fe0b53a0","resolution":{"observed_at":"2026-07-09T16:56:21.518321Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2018.00770","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.631694Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (2018)","venue":null,"work_id":"3a333a9f-f861-42ed-a778-eb6f339d4bfd","year":2018},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:b196e626f237e6b8155263d1412a9871f704c07dc195688f4d44539671139305","observation_id":"67aa37ef-0f09-4844-bfaf-d42982d72898","resolution":{"observed_at":"2026-07-09T16:56:21.633192Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2600.2020","doi":"10.1109/cvpr42600.2020.000154","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer 25 Vision and Pattern Recognition, pp","venue":null,"work_id":"9da51225-b7bd-4032-b7db-ca577971dafe","year":2020},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:241135dc4d4183624083ab558608bec69cf0ca3efef002c7f7a62647eaee5233","observation_id":"f9d8d34b-145e-4565-88e0-a8f62873770d","resolution":{"observed_at":"2026-07-09T16:56:21.601343Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v35i11.17220","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence (2021)","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"40d464b2-492a-4929-9188-60c00c1a8b78","year":2021},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:0cd905a2604b1596411b28cade1c9e1bba4ae71f2745a651488c715412edb970","observation_id":"d9932922-e5dc-4917-b023-c7422a472be2","resolution":{"observed_at":"2026-07-09T16:56:21.576782Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.782322Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"69995768-3559-45fb-9071-739c9245e23e","year":2017},"citing_paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-09T16:55:56.118110Z"},"links":{"citing_paper":"/paper/2607.07230"},"observation_digest":"sha256:2ac3f83cb886d369ff01c937fd2d9fc78042206dba9a14f2ec122ac2971192f1","observation_id":"b20d8382-f2cb-4e75-98f0-a4894924a58e","resolution":{"observed_at":"2026-07-09T16:56:21.783448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07230","last_updated":"2026-07-08T10:13:20Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T17:12:48.861143Z","submitted_at":"2026-07-08T10:13:20Z","title":"`Attention-Guided Cross-Temporal Clustering for Self-Supervised Video Object Segmentation"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":12,"metadata_mismatch":26,"parse_uncertain":0,"unresolved":1,"verified_exact":22,"verified_fuzzy":9},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2607.07230."}