{"as_of":"2026-08-11T17:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0eae7fa183863b29d0280de7df7653cbaaa73c8856ff53070bf96110c9eb1183","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:38:35.212457Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.07806/citation-record","integrity":"/paper/2501.07806/integrity","json":"/paper/2501.07806/citation-record.json","paper":"/paper/2501.07806"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:33.518112Z","title":"Frequency-tuned salient region detection","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.518112Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:f0cc428d82d7b53aff9293efbb57acef331b837d00091d381a40ae1b25b8d448","observation_id":"4936db02-db7e-4400-99cb-1381efe255fb","resolution":{"observed_at":"2026-08-10T20:38:33.518112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:33.523857Z","title":"Is space-time attention all you need for video under- standing?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.523857Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:d714a6bccc487d62d72a6fb5b55b6622575b866d15b5d6b6a49ac8f97ffa2b90","observation_id":"443fb97d-d403-4030-94b7-8bbcd7b7b1ac","resolution":{"observed_at":"2026-08-10T20:38:33.523857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00737","last_updated":"2019-05-02T13:40:43Z","snapshot_observed_at":"2026-07-06T07:49:58.221987Z","submitted_at":"2019-05-02T13:40:43Z","title":"The 2019 DAVIS Challenge on VOS: Unsupervised Multi-Object Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.00737","snapshot_observed_at":"2026-08-10T20:38:33.529320Z","title":"The 2019 davis challenge on vos: Unsupervised multi-object segmentation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.529320Z"},"links":{"cited_paper":"/paper/1905.00737","citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:87c65e00e0257695527995d6450ec43f710e706c3ecd9b37463c826e6c024517","observation_id":"398d27e4-ccc8-478e-9ccc-8be44185f3fb","resolution":{"observed_at":"2026-08-10T20:38:33.529320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:33.535550Z","title":"Re- thinking space-time networks with improved memory coverage for efficient video object segmentation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.535550Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:132f7da271218535271dfc1c5f2fb148e7d69c748a2182b6e34907b76688ebfb","observation_id":"17975af0-2c7f-498b-a87b-b827bb0ee6d5","resolution":{"observed_at":"2026-08-10T20:38:33.535550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:33.540612Z","title":"Structure- measure: A new way to evaluate foreground maps","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.540612Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:bd7198706336d76d640dfa50b1dba8c4a920ac07eb327c19b4a830e7fa996bf2","observation_id":"0ba73f2a-442a-438c-bf41-c301952c9432","resolution":{"observed_at":"2026-08-10T20:38:33.540612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12036","last_updated":"2024-03-26T08:09:43Z","snapshot_observed_at":"2026-08-04T13:19:53.195800Z","submitted_at":"2022-11-22T06:19:17Z","title":"Dual Prototype Attention for Unsupervised Video Object Segmentation","version":3},"cited_work":{"arxiv_id":"2211.12036","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.12036","snapshot_observed_at":"2026-08-10T20:38:35.683013Z","title":"Dual Prototype Attention for Unsupervised Video Object Segmentation","venue":"cs.CV","work_id":"9e8f9bde-4198-4653-9ca5-f213c671f7a6","year":2022},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.545731Z"},"links":{"cited_paper":"/paper/2211.12036","citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:f90e7cd9a16d3358e890b7f19349cb70d3c9129f6c46de0b8934e819ff416ddb","observation_id":"1f8a8830-f108-401a-9f83-3ae0543a577b","resolution":{"observed_at":"2026-08-10T20:38:35.766792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:33.551271Z","title":"Treating motion as option to re- duce motion dependency in unsupervised video object segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.551271Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:b9dd95c8a28c07247f500c1b0dd32a0a478e63150c4619f58b6d3779bb2b48f3","observation_id":"710b5785-6dc3-45c8-8e9e-6de38856a999","resolution":{"observed_at":"2026-08-10T20:38:33.551271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:33.555784Z","title":"High-performance long-term track- ing with meta-updater","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.555784Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:2b440d4538654277b201cdbceb9e1fee766d20ce8c2c6146edc4134d7572eb19","observation_id":"f800cf29-a992-4a43-937d-1019fb9b93c3","resolution":{"observed_at":"2026-08-10T20:38:33.555784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:33.560578Z","title":"FEANet: Feature-enhanced attention network for RGB-thermal real-time semantic segmen- tation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.560578Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:e9dc6ea403bee83ba0cf6c78e9b71cb348141bc95ef87108ba99825979687674","observation_id":"e7f3090b-e6e7-416c-a868-3cfdba32ab48","resolution":{"observed_at":"2026-08-10T20:38:33.560578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:39.511320Z","title":"Scaling up your kernels to 31x31: Revisiting large kernel design in cnns","venue":null,"work_id":"d695208b-6bd7-4677-9c7c-3a47190394ee","year":2022},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.565750Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:dd7c746f9cef8593506d4fe881b0ef811f30238a3e39ba7a26f60630dc5364d2","observation_id":"b97ce868-7562-4cd0-a456-f7301508e37e","resolution":{"observed_at":"2026-08-10T20:38:39.516747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:39.495720Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"363af04e-9182-41e7-8baf-123be4f63af3","year":2020},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.570871Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:c9ad67f9ded0cdeb5c66888f5941978234e5da4877f1d551490ce8c07ed36007","observation_id":"3064226b-2d59-43ea-ad55-adc659d470e4","resolution":{"observed_at":"2026-08-10T20:38:39.500889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.10421","last_updated":"2018-07-24T03:04:14Z","snapshot_observed_at":"2026-07-06T06:41:20.547019Z","submitted_at":"2018-05-26T03:29:38Z","title":"Enhanced-alignment Measure for Binary Foreground Map Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.10421","snapshot_observed_at":"2026-08-10T20:38:33.575998Z","title":"Enhanced-alignment measure for binary foreground map evaluation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.575998Z"},"links":{"cited_paper":"/paper/1805.10421","citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:d007c439f41c18fed3f1e6a4d66234adb06b4b94b0fb94936afabb29fc1bd9ca","observation_id":"43e90e70-9a6d-4845-8e25-eef66fcfc11e","resolution":{"observed_at":"2026-08-10T20:38:33.575998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:39.480002Z","title":"Shifting more attention to video salient object detection","venue":null,"work_id":"bdd3dbce-c0c7-4b83-877a-5b1c740c558a","year":2019},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.581241Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:4e0ac9f4d2f7bcc032e2f552ade27bf722da98399ff3641565beaf278740a4b1","observation_id":"fadede68-99d2-4106-82b6-04ab5d2d3c39","resolution":{"observed_at":"2026-08-10T20:38:39.484979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:39.408225Z","title":"Multiscale vision transformers","venue":null,"work_id":"f384ced9-caeb-4354-acdb-6583343b141c","year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.646863Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:9b4142e431d6bbcff335a6a128cba8a235156f05e1173a7b4440200d413018d1","observation_id":"e7de4dfc-60a5-42bb-88b5-905687b37846","resolution":{"observed_at":"2026-08-10T20:38:39.469463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:39.315556Z","title":"Pyramid constrained self-attention network for fast video salient object detection","venue":null,"work_id":"83d67da6-c138-4bf1-806d-f8167ced8ea6","year":2020},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.690111Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:328aff3406f3fc29f3697e4ba545e668adb73e5630bfa584d5f4444f9b00a594","observation_id":"ff4d3410-845f-4f21-96ad-3697463e80c7","resolution":{"observed_at":"2026-08-10T20:38:39.345814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:39.299550Z","title":"Cmt: Convolutional neural net- works meet vision transformers","venue":null,"work_id":"3b232049-0c66-490a-915d-b29c6f1b815a","year":2022},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.834139Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:69520e8dbf58ce74092dff0050a39f7ec9053612dfb8ba9a13ed3af9572d3264","observation_id":"72c69888-3fc4-42c1-9198-f96f916e0b17","resolution":{"observed_at":"2026-08-10T20:38:39.304256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:39.284515Z","title":"Benchmarking neural network robustness to common corruptions and perturbations","venue":null,"work_id":"641cd075-4abc-4ed4-9553-60dc49781213","year":2019},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.840122Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:6771a2be3c42973521a0ef7a008373f6562a8ffb40337829412d778e5f671c7f","observation_id":"9d39a87a-8efb-4a8e-80eb-9d50101fd38b","resolution":{"observed_at":"2026-08-10T20:38:39.289165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:39.270943Z","title":"Squeeze-and- excitation networks","venue":null,"work_id":"0e4fb0ce-57f6-4638-b583-f33332a17ee5","year":2018},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.845201Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:8695df386d7cc421f9b77f289622aa9867504bc22384c3798e45f1e571c9ae79","observation_id":"17203413-b0de-49f4-8f5f-9d93d979c613","resolution":{"observed_at":"2026-08-10T20:38:39.275400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:39.146120Z","title":"Goal-oriented Autonomous Driving","venue":null,"work_id":"9eadc8f6-1fa3-41b1-aac8-dd1b86c918a7","year":2023},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.849986Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:ebe618a1cc732817d4030e23b4a95341d3facbf33875d5bd0c949d1969a2fda0","observation_id":"77c4df42-b5d7-428b-8af9-016f07a4ee73","resolution":{"observed_at":"2026-08-10T20:38:39.238726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:39.131473Z","title":"Unsupervised video object segmentation us- ing motion saliency-guided spatio-temporal propaga- tion","venue":null,"work_id":"107f92db-ce85-44dd-bb23-95b8da0850e8","year":2018},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.855487Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:a40f4fd1004019594136980a4fa2885c7e0269f68fda9eaf9c3c03427812dbcc","observation_id":"da8c8392-699a-4800-89d4-cb03c857e742","resolution":{"observed_at":"2026-08-10T20:38:39.135984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:39.116665Z","title":"Video instance segmentation us- ing inter-frame communication transformers","venue":null,"work_id":"e0ed84d2-e951-457e-800f-738d8fae11c8","year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.859599Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:0081e880401e7ef4ff325554303d11757e0568dd1fe9cd2871cf7ee8dc643026","observation_id":"407d281d-3b0b-4c5e-b330-00e06f95a774","resolution":{"observed_at":"2026-08-10T20:38:39.121371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:39.101404Z","title":"Full-duplex strategy for video ob- ject segmentation","venue":null,"work_id":"71f36c65-bf2d-4eb8-a43d-21fc8998ad25","year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.903396Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:b8a3ec9581d30938548f8ddf0935788d266e4a3fb65a483914d0b2321b137974","observation_id":"603c7202-235a-4967-af39-09464c1ec448","resolution":{"observed_at":"2026-08-10T20:38:39.106103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:33.987574Z","title":"CASNet: A cross-attention siamese net- work for video salient object detection","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:33.987574Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:028488816377f8a392fa52e43c07421b937e5239d16acdd8a105b630c8bd2c57","observation_id":"60563b67-5eff-404a-b560-644ea81fb3f4","resolution":{"observed_at":"2026-08-10T20:38:33.987574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:38.986925Z","title":"Efficient in- ference in fully connected crfs with gaussian edge po- tentials","venue":null,"work_id":"e6572284-aeae-4dc3-a97a-af28a9fceace","year":2011},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.059285Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:bc2701f5b18a09a0a7623bf5c6f88e4a26e7a775657be4a1a233b428679e034c","observation_id":"e9912cb4-2f20-479a-bbb9-a5893911acca","resolution":{"observed_at":"2026-08-10T20:38:39.048824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:38.972241Z","title":"Guided Slot Attention for Unsu- pervised Video Object Segmentation","venue":null,"work_id":"2b886806-d978-43b5-a6c5-b8bb09fd536f","year":2024},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.075034Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:ba441ff6a81e1081a1ce96795959c017438a7d541941608e713a49ff36ea388b","observation_id":"c262b5cc-dcf6-4841-8181-bd4e32664a0a","resolution":{"observed_at":"2026-08-10T20:38:38.977155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:38.957712Z","title":"Unsupervised Video Object Seg- mentation via Prototype Memory Network","venue":null,"work_id":"406d4617-2590-451a-a840-3ae18a78dcba","year":2023},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.080838Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:cf4c164af1ae75f4eadc686a2fad05f3f0f41e8ec8f3025e5c56b92d5e5c9041","observation_id":"2beb1650-e46b-4c5a-a1eb-a93ea5359025","resolution":{"observed_at":"2026-08-10T20:38:38.962065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:38.942393Z","title":"Tsanet: Temporal and Scale Alignment for Unsupervised Video Object Segmenta- tion","venue":null,"work_id":"62ec75f7-2571-4698-92d9-facc7e723abf","year":2023},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.085424Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:0a421760b803dff5ab7c9637ecab9e9641726c40345114d294715e04017e8220","observation_id":"4a5abd55-2a3c-4648-aaaf-21423b105f85","resolution":{"observed_at":"2026-08-10T20:38:38.947188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:38.927449Z","title":"Itera- tively selecting an easy reference frame makes unsu- pervised video object segmentation easier","venue":null,"work_id":"c3305764-ff5f-4bcc-818e-e7b5b6a4cbce","year":2022},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.090559Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:590e70e3948f3e197a4efdf84f2afaf23a6e0dc9f0f3efb03f34bc7a851caa70","observation_id":"996849d3-31d4-4d89-a6cb-85d490b76486","resolution":{"observed_at":"2026-08-10T20:38:38.932413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:38.912187Z","title":"Video segmentation by tracking many figure-ground segments","venue":null,"work_id":"86c0f2d9-e913-4fff-b7eb-87081cc9fbb9","year":2013},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.094439Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:c1031d800e82b6293b0beb7603e1cb6e3a33a409ce60e452aa67225b0cbdca31","observation_id":"154e25ad-4583-4123-a498-0693ec56e8e8","resolution":{"observed_at":"2026-08-10T20:38:38.917727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:38.743044Z","title":"Self Supervised Progressive Network for High Performance Video Object Segmentation","venue":null,"work_id":"d5c0c52a-c1ee-43c7-abcf-978dffb5ebdf","year":2022},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.117518Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:b84e3abc3133b80bbebae9560b5bbc1912693f5e3bfb9e71d740eac685da7efc","observation_id":"39349fe2-5273-4adb-b5c4-f35d917f06b5","resolution":{"observed_at":"2026-08-10T20:38:38.847286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:38.651994Z","title":"Efficient long-short temporal attention network for unsupervised video object segmentation","venue":null,"work_id":"485a6114-7f86-4aaa-8f51-e7893fc321c9","year":2024},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.135637Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:bc2b309a567a9e24475d9b93ebee9d49b3f82d45659743f79f9e6195a343949e","observation_id":"b743baf2-7f69-4232-bcd8-2f071897ec8f","resolution":{"observed_at":"2026-08-10T20:38:38.656530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:38.636016Z","title":"Instance embedding transfer to un- supervised video object segmentation","venue":null,"work_id":"f22157ea-734e-4749-88e9-e7cf851314ac","year":2018},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.148681Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:bdeb6a1de16dd627a2978f15abd33cd2a2db06edc0f9c518cb9ed0963c390ae0","observation_id":"7bd2ac31-2891-454a-b052-980316d31a80","resolution":{"observed_at":"2026-08-10T20:38:38.641442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:38.621893Z","title":"Video object segmentation with adaptive feature bank and uncertain-region refinement","venue":null,"work_id":"f3299589-ad39-4bb6-bf63-d31d5e83e2e4","year":2020},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.153010Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:ee52cfbfa23eb91a0590b74f642d976b880a3ffa84a0ab859c6c505ed98ff041","observation_id":"bf8747d6-3ec8-47d9-9d15-9eb84d053b1c","resolution":{"observed_at":"2026-08-10T20:38:38.626331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:38.443830Z","title":"F2net: Learning to focus on the fore- ground for unsupervised video object segmentation","venue":null,"work_id":"67090721-9449-4bf7-8295-438a2600856d","year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.157330Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:3648b8e085d0b171145d6fa4b08f30948dbcdf5e5a7e38e7d49eea5f5db9fd2f","observation_id":"1b7e31d7-96ea-483c-ba22-57957dcc0f90","resolution":{"observed_at":"2026-08-10T20:38:38.547637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.04838","last_updated":"2023-11-24T16:29:19Z","snapshot_observed_at":"2026-08-10T07:41:02.008144Z","submitted_at":"2022-03-09T16:12:08Z","title":"CMX: Cross-Modal Fusion for RGB-X Semantic Segmentation with Transformers","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.04838","snapshot_observed_at":"2026-08-10T20:38:34.177341Z","title":"CMX: Cross-modal fusion for RGB- X semantic segmentation with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.177341Z"},"links":{"cited_paper":"/paper/2203.04838","citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:5c4020455f33421189a8c43cbadfe5829add6debcaf33fafb18d3f47f3dc7c2d","observation_id":"fe4597f4-caeb-4483-94c4-d607ff5a5d2b","resolution":{"observed_at":"2026-08-10T20:38:34.177341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:34.223859Z","title":"Learning Complementary Spatial- Temporal Transformer for Video Salient Object Detec- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.223859Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:483f05378542fc1a835f1850f0bca1907fcbf6b0616710f3f9213b1dc6fb729c","observation_id":"a28c433d-83d5-455c-997a-bb3fba06535d","resolution":{"observed_at":"2026-08-10T20:38:34.223859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:38.428814Z","title":"A survey of visual transformers","venue":null,"work_id":"0613e068-3693-41af-ae2f-3e51f1710bb2","year":2023},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.294142Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:352685f9896e3bcae570edd9e2f9fb5a9e9881a87c200e258bc1f3fd2785beff","observation_id":"1c70f6b8-4ee0-4ffa-918f-a645beee2ca2","resolution":{"observed_at":"2026-08-10T20:38:38.433685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:38.414579Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"2b1c594f-2532-475c-aa7f-1d06327146f2","year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.340306Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:caaf7f2175741b4fd467ff270038edb1dcd653f3a25f585670081aca0b2e3f9a","observation_id":"0e6ba557-0337-4ce7-b1f3-40a70053369a","resolution":{"observed_at":"2026-08-10T20:38:38.419459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:38.399946Z","title":"Video swin transformer","venue":null,"work_id":"3e03de71-1449-4f83-a857-a99e46b90149","year":2022},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.346784Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:454beaae74bdcd92f48868e48a5183a1e20fa87f2fe58897a711c50a97f69f42","observation_id":"359a8cd0-f5d2-441a-beba-f256135761f7","resolution":{"observed_at":"2026-08-10T20:38:38.404687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:38.329845Z","title":"A convnet for the 2020s","venue":null,"work_id":"078c3ff5-09eb-4812-b55b-f4e5b7a484c8","year":2022},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.352079Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:05ec372c77f41623461b843a7e32955c5772b3d5c4dd83c27becc1edd11af864","observation_id":"5e1885c2-3124-48bc-903a-d6e10a8b6692","resolution":{"observed_at":"2026-08-10T20:38:38.390057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:38.177774Z","title":"Fully convolutional networks for semantic segmenta- tion","venue":null,"work_id":"4ae089f2-0168-47a3-9df0-8ca4c92117fe","year":2015},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.357732Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:29f4f3ad526d0dafdc807039387a19da25e7a780ef1e0118230ce3b951bef803","observation_id":"fded7d71-a7e5-4485-b754-ce1ad941b224","resolution":{"observed_at":"2026-08-10T20:38:38.243702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:38.162573Z","title":"Learning video object segmenta- tion from unlabeled videos","venue":null,"work_id":"298c6fcc-798f-4393-9650-63e7b973876b","year":2020},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.362936Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:59926a02e26d00b51335dc1cf4cf463a55afdac1af2dfe0771d42635a88e40cb","observation_id":"bff73bb4-a9ab-4db6-b384-5da25a2efc4c","resolution":{"observed_at":"2026-08-10T20:38:38.167348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:38.147014Z","title":"See more, know more: Unsupervised video object segmentation with co-attention siamese networks","venue":null,"work_id":"496b0fef-ee6a-4271-beee-3b7603865fe2","year":2019},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.367455Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:73c00855573ccb4f7fe93bc4c0f6b3117a675a3116a27fea7beecab2d57639f0","observation_id":"49bb00de-52b9-4a3d-8580-349433adc0a8","resolution":{"observed_at":"2026-08-10T20:38:38.151929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-10T20:38:34.371553Z","title":"Mixed precision training","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.371553Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:c482ad96bed66c6042219201e382804550c5490d165f60c0756679513efa6d2d","observation_id":"77441ce2-705c-440c-9a1b-87001358f4be","resolution":{"observed_at":"2026-08-10T20:38:34.371553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:38.061625Z","title":"Seg- mentation of moving objects by long term video analy- sis","venue":null,"work_id":"1142f344-f810-4da9-a70a-7a7f6c707816","year":2013},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.376293Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:0594a9c900f3c410f6f2be4449b5c8dbefae8fd342d1b03aff644b34a0212756","observation_id":"c6be2327-3130-4935-8c1f-1502dd765670","resolution":{"observed_at":"2026-08-10T20:38:38.136536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:37.968263Z","title":"Fast object segmentation in unconstrained video","venue":null,"work_id":"1093357b-4698-4b6f-9a36-5f95400e4ba3","year":2013},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.380807Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:b5ed812492caff346ea9ce053d18513e628e1b2ebb2e23ee11737c50ba4df988","observation_id":"98b53120-b4b8-4f72-a2c1-15fd1e74db3c","resolution":{"observed_at":"2026-08-10T20:38:38.003461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:37.952824Z","title":"Hierarchical feature alignment net- work for unsupervised video object segmentation","venue":null,"work_id":"55683c2c-5713-427a-9577-850c039d7c02","year":2022},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.384913Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:87b1c2ad396e9695b07ac211844287a779f857979041c574d528629d41b2062b","observation_id":"d9e178ab-5942-4fca-9229-11686eb15cfc","resolution":{"observed_at":"2026-08-10T20:38:37.957941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:34.389221Z","title":"Hierarchical Graph Pattern Under- standing for Zero-Shot Video Object Segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.389221Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:8283ccb8b1b2de367b86d924e9377dfceafe8028a2bc170a12b4b95d98b86b36","observation_id":"4273481d-b1c0-45f1-941f-469d5db785b9","resolution":{"observed_at":"2026-08-10T20:38:34.389221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:37.938341Z","title":"A benchmark dataset and evaluation methodology for video object segmentation","venue":null,"work_id":"bacee408-955b-462c-800a-ef465aca20a1","year":2016},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.393905Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:efb22fcf7ca22a4e4891963482e60388dccd4c592efe8173f8b913aa71fb6283","observation_id":"fb63f21b-44bc-4e60-a2e0-9cd44b650b48","resolution":{"observed_at":"2026-08-10T20:38:37.942749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:37.803437Z","title":"Saliency filters: Contrast based filtering for salient region detection","venue":null,"work_id":"197a35a7-a915-4675-8df4-24e83daf009e","year":2012},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.425411Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:2ebe8d360e4ec5c37d9f507b99ebc476a92047d8c7fda298451c6fb61f3475b5","observation_id":"ea7f1df1-45a2-4f29-9959-1f27885d2d95","resolution":{"observed_at":"2026-08-10T20:38:37.858051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:37.787903Z","title":"Learning object class detectors from weakly annotated video","venue":null,"work_id":"b0d6207f-adde-4431-afe5-fb06050cb6f9","year":2012},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.431897Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:eb772d6aaeab6e4314f30e2ba071d07426f99986b17b7e7612cff183b4367d79","observation_id":"92d88812-16a3-4123-86e2-ad39626b03a4","resolution":{"observed_at":"2026-08-10T20:38:37.792777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.07355","last_updated":"2019-01-11T19:10:46Z","snapshot_observed_at":"2026-07-06T07:28:14.627901Z","submitted_at":"2019-01-11T19:10:46Z","title":"Optical Flow augmented Semantic Segmentation networks for Automated Driving","version":1},"cited_work":{"arxiv_id":"1901.07355","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.07355","snapshot_observed_at":"2026-08-10T20:38:35.380095Z","title":"Optical Flow augmented Semantic Segmentation networks for Automated Driving","venue":"cs.CV","work_id":"86b52590-22d7-401c-85e9-059cbb8c1718","year":2019},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.436817Z"},"links":{"cited_paper":"/paper/1901.07355","citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:3b6f6fb68a2cd9d273d3f23221322ce3dfa2c4d6d8251a69f45d432077b4b412","observation_id":"0403af32-fc35-4795-b02d-9182607a6b91","resolution":{"observed_at":"2026-08-10T20:38:35.387916Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:37.773515Z","title":"Reciprocal transformations for un- supervised video object segmentation","venue":null,"work_id":"33f737c6-af39-4685-a1cd-ff2eb310c0e0","year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.441609Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:9170cec0f95cc4f6798820e6e33d1be61d37b1dd7ce87613baab26acb69639cf","observation_id":"75afa75a-fc5f-41ca-a0c6-95162abec59a","resolution":{"observed_at":"2026-08-10T20:38:37.778274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:37.759116Z","title":"Pyramid dilated deeper convl- stm for video salient object detection","venue":null,"work_id":"6413bbd7-fcaf-46d8-8cf8-9642aa435cb1","year":2018},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.446225Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:e7acc4ce073d94643ba8459035e929bc365d1999b8693e79e5ad77fd35a3d659","observation_id":"7f4f3f41-0438-420f-b2bc-ab210fe93594","resolution":{"observed_at":"2026-08-10T20:38:37.764043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:37.702902Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":"4c882320-d826-4247-8f40-20807d2910e5","year":2020},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.450446Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:7fe9436a41a404bc23ac73da33f9bfb8c36716afe0529060dfae7c5ad69ee2fc","observation_id":"4f6e6c71-9b33-4b5d-9f6c-41401e008d5b","resolution":{"observed_at":"2026-08-10T20:38:37.749187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:37.646031Z","title":"Learning video object segmentation with visual memory","venue":null,"work_id":"3c9587ae-d955-41ac-a0f2-507c4316aa77","year":2017},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.454786Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:cad95cef6066ff39392a0e1a59afd541b555bcdaf8e94d13e294b73a92aa2f20","observation_id":"cbe5f4ed-caaa-4dc5-a4a6-cafec6e1e8d6","resolution":{"observed_at":"2026-08-10T20:38:37.655498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:37.631118Z","title":"Attention is all you need","venue":null,"work_id":"54fa9b8e-9a2b-467b-9161-18bf8242c202","year":2017},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.458683Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:787403ad56abb9d059bd9022a6a319628e465c8f5681d010abdd8c9dbdce8d49","observation_id":"17201fc7-e1f2-4f06-b09e-141acc6916ba","resolution":{"observed_at":"2026-08-10T20:38:37.636049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:37.547593Z","title":"MASK-RL: Multiagent video object segmentation framework through reinforcement learning","venue":null,"work_id":"d0fe0c3e-15ed-41f7-bd98-43c10c3a081c","year":2020},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.462882Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:6e6e4704ed8b7cd0526ae4247914dc67a8d9542997ece3908775fc29edeafdda","observation_id":"3cd11f99-db8d-4e0d-bd4e-2e33d7e92216","resolution":{"observed_at":"2026-08-10T20:38:37.606950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:37.534222Z","title":"Con- sistent video saliency using local gradient flow opti- mization and global refinement","venue":null,"work_id":"4a41c703-e466-42b8-8bc8-ed8dbb223bfc","year":2015},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.467357Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:1bb571451496c14e6d6515fdb3bf67f06043f78c8dafe25a5adf5b96aad4bbb9","observation_id":"266f6f6c-c0dc-469c-a708-efec1e84ffaf","resolution":{"observed_at":"2026-08-10T20:38:37.538504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:37.517579Z","title":"Video salient object detection via fully convolutional net- works","venue":null,"work_id":"535e56f9-f226-452f-a6f0-ddfbfe5f494c","year":2017},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.473530Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:2d4c5ad10e611073cfc9b6e4aba02b1280f4a08572d48efe4ae43c6b55e29d0b","observation_id":"c2c553f5-8180-4634-a069-1be65c6c0552","resolution":{"observed_at":"2026-08-10T20:38:37.523712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:37.340324Z","title":"Learning unsupervised video object segmentation through visual attention","venue":null,"work_id":"66abe574-4947-4742-9ca8-9abce8ac04ab","year":2019},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.478772Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:8c72982b6f6c8396fb415966c9d61e476e8193e6f3eaee0dbfc81f4297e892f9","observation_id":"037d1a9e-7063-4712-83ad-6f1f4729a8c7","resolution":{"observed_at":"2026-08-10T20:38:37.430218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:37.325412Z","title":"Saliency-aware video object seg- mentation","venue":null,"work_id":"41647310-6bc2-45db-b56c-481f9299ea59","year":2017},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.483831Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:2a0ed9b90a83bdeb09bc81241ff31fdedba559668bc8555a75ea15bfe1e6dc02","observation_id":"a83ff2ab-e2a5-4768-98e7-d8b0d4376ee7","resolution":{"observed_at":"2026-08-10T20:38:37.330524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:37.308756Z","title":"Salient object detection in the deep learning era: An in-depth survey","venue":null,"work_id":"3046293a-46e9-4f1e-b644-c58f3091891a","year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.488311Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:400708e928bb35c428d089fcfc5cc1bd43ec49ef00687fe9c9d7dedf5d907ff2","observation_id":"3ce571cf-dbd2-40e7-b3e0-95f06f97761f","resolution":{"observed_at":"2026-08-10T20:38:37.314230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:37.206125Z","title":"Zero-shot video object segmenta- tion via attentive graph neural networks","venue":null,"work_id":"278e26c8-5a7e-433c-9988-d3948dc7b391","year":2019},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.503639Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:30b2d9daabaff6f7ee87be6e4d12e7e34b96ab230784e4588a6580ce90f5e98f","observation_id":"39df4b88-a630-4881-b7b7-c892322f3db0","resolution":{"observed_at":"2026-08-10T20:38:37.298723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:37.131633Z","title":"Pyramid vision transformer: A versatile backbone for dense prediction without convo- lutions","venue":null,"work_id":"e2ef0cd1-c7e6-48ba-bf7c-9962383ceab4","year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.630084Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:fa57b60989190720c37c5af637bb64483b8ce377e917d32b69a7d54970fe337c","observation_id":"e2b6eefb-0d96-41d3-8a59-feb2686e7238","resolution":{"observed_at":"2026-08-10T20:38:37.137064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:37.116354Z","title":"Non-local neural networks","venue":null,"work_id":"ec4cf4a0-6162-4c97-b819-7811e3477adb","year":2018},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.710589Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:889649bc95e6ed4a0c9b507e81578fd28543961bdb45cdd0bb22db8a07a8305e","observation_id":"8c562fde-0f84-4fd7-9cc9-fc7fbea0a625","resolution":{"observed_at":"2026-08-10T20:38:37.120908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:37.017837Z","title":"Multimodal token fusion for vision transformers","venue":null,"work_id":"cdab4eaa-cc33-468f-9ef6-4df4b93d33bf","year":2022},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.753747Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:f346566db0dce279513964e98b1e5f074f18c32b3c7bf53530a168dc3559d2d9","observation_id":"2547a403-9abd-44ca-be75-0aa52601e11c","resolution":{"observed_at":"2026-08-10T20:38:37.104591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:36.904127Z","title":"End-to-end video instance segmen- tation with transformers","venue":null,"work_id":"188ba6ae-c2c4-4d54-abee-1005e0269549","year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.839938Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:41e53e6ce393180dbfe151e0da6a2e9f95731144798ccc62459a424b3547b58e","observation_id":"c2fd896b-ec32-4c26-9329-6a219e3b7860","resolution":{"observed_at":"2026-08-10T20:38:36.942663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:36.888681Z","title":"Youtube-vos: Sequence-to-sequence video object segmentation","venue":null,"work_id":"9a46b8c1-ee16-43ad-aee4-7e410bde6292","year":2018},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.884727Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:0b3106abe7eb8d5ed8fab253bdf2b9507b1bd84ddd3ffa23b007dbca4cf19f4b","observation_id":"a71c934c-9504-4c05-bd2f-eaf799cb59f6","resolution":{"observed_at":"2026-08-10T20:38:36.893486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:36.723553Z","title":"Video enhancement with task- oriented flow","venue":null,"work_id":"4237a760-55a5-4543-93d3-e335121471fa","year":2019},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.889611Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:f1e3b4659f47341cad3c40bab8a778bce5f4b0eac5ac417128cba1861db835e6","observation_id":"1a9213bd-48a2-4c97-9091-c170c7efa05b","resolution":{"observed_at":"2026-08-10T20:38:36.791092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:36.707549Z","title":"Semi-supervised video salient object detection using pseudo-labels","venue":null,"work_id":"a6037910-811b-4e2b-9ed6-01ef286feccd","year":2019},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.894699Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:632d1dd4a90756b8d2984f0dc5e3343f2e67db2a2ab27d1031b9ecd7e4c85298","observation_id":"af66fe3f-37cb-49f5-8aa9-44be8fa5756f","resolution":{"observed_at":"2026-08-10T20:38:36.712811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:36.690935Z","title":"Learning motion-appearance co- attention for zero-shot video object segmentation","venue":null,"work_id":"6566a2c4-5e7c-4bec-9d03-78ffa692dc0f","year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.899520Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:d0355c9bbf694df86f6b7581a06ebaa48eb9a1011f75d2f8bf7b30e95c778631","observation_id":"086a450e-6893-4d78-ac2f-c9dc20dd134d","resolution":{"observed_at":"2026-08-10T20:38:36.697323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:36.675770Z","title":"Associating objects with transformers for video object segmenta- tion","venue":null,"work_id":"5fa7fd8a-cb46-4ac5-98b8-65aa2a143880","year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.909333Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:b9428aa4de0b36df261d8e01186d6b12a64602f538fd4d36bc813a663e639907","observation_id":"a64761b2-295b-4d28-8232-1cd087f11f85","resolution":{"observed_at":"2026-08-10T20:38:36.680945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:36.617445Z","title":"Directional deep embedding and appearance learning for fast video object segmentation","venue":null,"work_id":"d1c79e95-3e8a-4293-9e4c-f825b97c3a26","year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.932917Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:c5bba48c0a4e24632ad898889808cb05448b48d2864d0489204b61b8a36c8b03","observation_id":"8e0db9dc-3fbd-4137-899e-8b6e853cf23b","resolution":{"observed_at":"2026-08-10T20:38:36.664958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:36.428930Z","title":"Learning joint spatial-temporal transformations for video inpainting","venue":null,"work_id":"2b314e62-f3f9-42d5-b30c-1f275d00afb0","year":2020},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.947461Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:ffe5567df8417cf9eaba12618debd080db6af7958816dd0092cfe9ce512adc5f","observation_id":"2873fe09-d186-4a04-beda-a496c19c8e7e","resolution":{"observed_at":"2026-08-10T20:38:36.532926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:34.952991Z","title":"Adaptive semantic-enhanced trans- former for image captioning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.952991Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:4335b47a128b2a21409c9a3a9b78ee47c252c26b2db57e993a6e4edf188c90a7","observation_id":"71f04280-6781-46d7-b631-de2d756126d8","resolution":{"observed_at":"2026-08-10T20:38:34.952991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:36.403128Z","title":"Deep transport network for un- supervised video object segmentation","venue":null,"work_id":"9cf417be-48f5-4918-a486-8ed45db065be","year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.958470Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:eb54419eaa32fc96fb5d17cc04b327ef150d474a0c86b8a0fe0425868cab22b8","observation_id":"c102e527-d5b5-48d4-8b55-f1c07ada4ef6","resolution":{"observed_at":"2026-08-10T20:38:36.409226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:36.386346Z","title":"Dynamic context-sensitive filtering network for video salient object detection","venue":null,"work_id":"3b26f279-3183-4d4b-8344-9b5907937aed","year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.962902Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:9766bbecbf7db3c8c685728b514f0d1a8dbddb5996246e1cbd80dfac0b716d38","observation_id":"c03058c6-c0d3-4637-8e93-685dea42215b","resolution":{"observed_at":"2026-08-10T20:38:36.392118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:36.304207Z","title":"Learning regression and verifica- tion networks for robust long-term tracking","venue":null,"work_id":"772b1437-935d-49b6-808c-0fc8ffb05282","year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.967587Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:00099c05a318bc00879d714b2e1e4b0b457c81b743a26e5753d89616661199e6","observation_id":"7ab6c1d0-232c-40b4-84fa-65729a105c42","resolution":{"observed_at":"2026-08-10T20:38:36.374774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:36.120094Z","title":"Mitigating modality discrepancies for RGB-T semantic segmentation","venue":null,"work_id":"17927577-d3b2-4410-88dd-6bfa0e01dffb","year":2023},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.972886Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:3111305442d96b1ea539df770a28b0dfa94c19b19e89cb3b76380cb9f4a304c9","observation_id":"d507f325-97a5-4eca-97e3-347d8152ef79","resolution":{"observed_at":"2026-08-10T20:38:36.203752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:36.103671Z","title":"Multi-source fusion and automatic predictor selection for zero-shot video object segmenta- tion","venue":null,"work_id":"7532fe5f-e954-4b68-9442-74aa9d8c7205","year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.978054Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:2d092280086c224efb438348b6944b9d0510abe408bad49987f68a659a9177be","observation_id":"039e341f-49b7-4d29-9c05-092976d5288e","resolution":{"observed_at":"2026-08-10T20:38:36.109037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:36.087958Z","title":"Learning discriminative feature with crf for unsupervised video object segmentation","venue":null,"work_id":"683f1d2a-af62-47b6-aa6f-5e3a7996e330","year":2020},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:34.982007Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:44640ae6b10556e0c114a39bf61da44313d6dbcc044bf8bd9cc1e35eb0ef31db","observation_id":"e1649038-8c4d-404f-b081-be8c89e3c499","resolution":{"observed_at":"2026-08-10T20:38:36.093323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:35.953432Z","title":"Self-teaching video object seg- mentation","venue":null,"work_id":"8a57ea35-d746-46d8-8950-3e9cefb4bf0c","year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:35.048077Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:7b598e2b6189bfdb6c7f413d594d6a97f946b66c2aff309309936eb27b8ee81f","observation_id":"9e561a50-18d4-4a9b-b053-790a46968f4c","resolution":{"observed_at":"2026-08-10T20:38:36.036399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:35.936901Z","title":"A survey on deep learning tech- nique for video segmentation","venue":null,"work_id":"a1497ac8-0263-4ecf-aced-e5ee1d70ff0b","year":2022},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:35.171027Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:8a97b2ce082a800d5260dd5dc7540ee5610eba0abe06374e384a3228c28774a5","observation_id":"f7d66e16-2e41-4e18-be97-7226dd2cf52f","resolution":{"observed_at":"2026-08-10T20:38:35.941511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:35.921814Z","title":"Motion-attentive transition for zero- shot video object segmentation","venue":null,"work_id":"153a0e28-9211-42b2-a327-f81c5bd3b171","year":2020},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:35.175597Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:d926739e8ac154757b4c039196ee80ed7c9cd836f2ae646a8be49bd47d84e218","observation_id":"abb82870-4dba-4559-a6d7-d311429755bf","resolution":{"observed_at":"2026-08-10T20:38:35.926722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:35.907037Z","title":"Deep feature flow for video recogni- tion","venue":null,"work_id":"3d6df303-5bd0-484f-9a92-1bf32e39b737","year":2017},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:35.179683Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:780d378d9973175b3d52c551aa2033fdc733c8d59ce613ccac200ff5121ecd57","observation_id":"386b38f0-c482-4ab4-91da-ad5af2a5d270","resolution":{"observed_at":"2026-08-10T20:38:35.911638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:38:35.890828Z","title":"Perception-aware multi- sensor fusion for 3d lidar semantic segmentation","venue":null,"work_id":"b538146d-22cb-4e22-bb52-6da57b71b7eb","year":2021},"citing_paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:35.212457Z"},"links":{"citing_paper":"/paper/2501.07806"},"observation_digest":"sha256:168b2d8ab75066bdbb23d0dbe4809eeeebe63e1561897cb9dca05a4d667db73f","observation_id":"7823b5a2-bded-4994-ae21-8dfe7a7f0597","resolution":{"observed_at":"2026-08-10T20:38:35.896507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.07806","last_updated":"2025-01-14T03:15:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T20:33:10.891442Z","submitted_at":"2025-01-14T03:15:46Z","title":"Learning Motion and Temporal Cues for Unsupervised Video Object Segmentation"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":2,"verified_fuzzy":70},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 0 inbound Pith citation observations for arXiv:2501.07806."}