{"as_of":"2026-08-09T03:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e700d1726dbec7059ca7ffc3c21c4f16f5d4dad61820da9db67ea816cea8b3f5","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:52:16.689829Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.19242/citation-record","integrity":"/paper/2508.19242/integrity","json":"/paper/2508.19242/citation-record.json","paper":"/paper/2508.19242"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.05483","last_updated":"2024-07-07T19:55:09Z","snapshot_observed_at":"2026-08-02T03:13:14.123634Z","submitted_at":"2024-07-07T19:55:09Z","title":"Just read twice: closing the recall gap for recurrent language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05483","snapshot_observed_at":"2026-08-05T15:52:16.392102Z","title":"Just read twice: closing the recall gap for recurrent language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.392102Z"},"links":{"cited_paper":"/paper/2407.05483","citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:ab1c29960347fd6139703cb2000e97ddf5b083f97fe40fd4549b2f5d74fce804","observation_id":"86b416ae-2ac7-42d1-906c-40a7941ad941","resolution":{"observed_at":"2026-08-05T15:52:16.392102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.713948Z","title":"Tarvis: A unified approach for target-based video segmentation","venue":null,"work_id":"d4614298-f5da-46b7-b265-f4644f690d85","year":2023},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.398111Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:53dfca0904668b94d7cc5d91a0bc5d8d6fda7ff97ddb8f70f34247cba319ba74","observation_id":"ae6d0bf0-1b02-4538-841f-12baaedb2af1","resolution":{"observed_at":"2026-08-05T15:52:17.722317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.696421Z","title":"End-to-end object detection with transformers","venue":null,"work_id":"cf4da0c0-9ce8-4bcb-a3e7-248eaddc34fd","year":2020},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.403264Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:bb88b25d736be202dd586133649070993dcb1353541261746ee37047d151be26","observation_id":"ca615088-376e-49bc-9125-482cc92f49a8","resolution":{"observed_at":"2026-08-05T15:52:17.701666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.678442Z","title":"Per-pixel classification is not all you need for semantic segmentation","venue":null,"work_id":"d0ec9a43-ec8a-47aa-814c-9b04b8c648a1","year":2021},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.408380Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:4af18a34eae3b50c306cafe3718a71366f94c9cf97f9c90c52ac8337fff41287","observation_id":"97f0ece7-c232-4467-a313-477f1bf25b58","resolution":{"observed_at":"2026-08-05T15:52:17.684671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.660641Z","title":"Masked-attention mask transformer for universal image segmentation","venue":null,"work_id":"73230f5f-f78b-405f-8557-00b5b3158037","year":2022},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.413889Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:b780217d877606de49ebf70ac5a068117329b38546d6ed30e46314ca6a518c37","observation_id":"b9172dd7-93d9-4e20-bdb8-7d22ae9c4c11","resolution":{"observed_at":"2026-08-05T15:52:17.666164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.644264Z","title":"Xmem: Long-term video object segmentation with an atkinson- shiffrin memory model","venue":null,"work_id":"c034130c-a2df-423e-9bbb-fbc209b9a251","year":2022},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.419859Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:e08607891f55d39b7f7b5c98e0573bfaa3f67ef66379fd4f0821a5c7154dc347","observation_id":"7913f846-7918-44f7-a6cc-7bcf07e5d27c","resolution":{"observed_at":"2026-08-05T15:52:17.649604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.627304Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":"9c606cde-74e6-409d-be04-109747f772e1","year":2016},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.427098Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:7292d54a0b0e1cfd241ac5625c651e8d5e82b7057dd08908c6bc90ddf8eafd08","observation_id":"f6c0c31c-4410-4c91-932d-c6b70941c826","resolution":{"observed_at":"2026-08-05T15:52:17.632470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.609366Z","title":"Mose: A new dataset for video object segmentation in complex scenes","venue":null,"work_id":"4e3f195a-e102-4d0d-a248-6f115921b926","year":2023},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.431862Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:5ec76077699e6f2cd6507943302f93c0f67d8c9b5bf5412e1b84e163b3e065f5","observation_id":"4731e06c-f2f2-47e9-bae1-045836d56a9c","resolution":{"observed_at":"2026-08-05T15:52:17.614476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T15:52:16.436505Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.436505Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:8c068805021e27415d3e9a4faaa2f2f31dbf3abd75f09e8a26d2cbfce52dafc8","observation_id":"bb0d6999-317a-475b-9b9a-693a1fadbb33","resolution":{"observed_at":"2026-08-05T15:52:16.436505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-05T15:52:16.441780Z","title":"Mamba: Linear-time sequence modeling with selective state spaces.arXiv preprint arXiv:2312.00752, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.441780Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:eee0bb33673059ab92bc2bc6e8aff0b592fd52666098e41ff59c42f9a2d3a4ef","observation_id":"2649edb2-2207-4798-9572-e6178d0e3a6c","resolution":{"observed_at":"2026-08-05T15:52:16.441780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-05T15:52:16.447019Z","title":"Efficiently modeling long sequences with structured state spaces","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.447019Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:093706aca65d9debc7f195eafa45e56efefcdb7b31a7b9ab87ff4904a93c25db","observation_id":"d91cf4ff-0e1e-4bb8-bc3b-92b85d64b33e","resolution":{"observed_at":"2026-08-05T15:52:16.447019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.593406Z","title":"On the parameterization and initialization of diagonal state space models","venue":null,"work_id":"ea1fe1b6-30f5-48e5-9237-3a3f3cddb0ff","year":2022},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.453019Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:83bd4f4bb8fe692e4de6d94c12f412dbf6ddc28939e6717e62feca6fd2e424df","observation_id":"57c9f109-2d46-4f4e-bbcf-e234a9c7b385","resolution":{"observed_at":"2026-08-05T15:52:17.598398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.577089Z","title":"Vita: Video instance segmentation via object token association","venue":null,"work_id":"31bf13d2-c173-4c38-a27e-46f667e2f73f","year":2022},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.457809Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:3a9deebc80649dd7b810e852f7534e1f06c3f105c9e4e3c515e17362318524b5","observation_id":"2d6e736f-e66b-42c0-9932-5169ac518a0f","resolution":{"observed_at":"2026-08-05T15:52:17.582327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.560269Z","title":"A generalized framework for video instance segmentation","venue":null,"work_id":"7f877594-4a94-48ac-abf4-0bbc9f5a90a6","year":2023},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.462408Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:63371923978e780a4acbea9feda2e1bd60fbd710f0d509c5adae716f4c015b09","observation_id":"4a4bd33f-9d05-4b97-861b-8397af59a42d","resolution":{"observed_at":"2026-08-05T15:52:17.565401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.543793Z","title":"Omni-rgpt: Unifyingimageandvideoregion-levelunderstanding via token marks","venue":null,"work_id":"6074a8ba-d168-443d-8971-db0618b335a1","year":2025},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.467534Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:75ff97ca764b298fa0147c0397cb901b8a91fd8664275db3081c51c1298c0af2","observation_id":"d08d82a7-5b73-4a83-ba97-14940e838a40","resolution":{"observed_at":"2026-08-05T15:52:17.549091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.526374Z","title":"Robust and consistent online video instance segmentation via instance mask propagation","venue":null,"work_id":"18f2acda-060d-4a15-bf08-694dcc737ae6","year":2025},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.472268Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:cef33b227e9d2bdcdf0bb738c67d4d1bb99f5dbc731500339ee3a74a0df083a6","observation_id":"e5c62569-62d9-46f9-9be6-c0416591949a","resolution":{"observed_at":"2026-08-05T15:52:17.532803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-07-06T17:58:00.820879Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-05T15:52:16.476792Z","title":"Ruler: What’s the real context size of your long-context language models?arXiv preprint arXiv:2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.476792Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:11c20f5ec43f558d5be812a4f50fac1ad41c3f215e4787def2031c4c06fc0fda","observation_id":"cd06ca60-2ec1-4a76-b8b5-03085f6dc174","resolution":{"observed_at":"2026-08-05T15:52:16.476792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.509682Z","title":"Minvis: A minimal video instance segmentation framework without video-based training","venue":null,"work_id":"04d20633-90ec-44db-ac25-b6f8ba2bf7db","year":2022},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.482625Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:1601d05d22c9ec0418d4de57e0553d855431138659935231224dfd460d50ba08","observation_id":"c0b308c0-6515-4f70-9e8f-71e5b060850d","resolution":{"observed_at":"2026-08-05T15:52:17.514993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.492887Z","title":"Video instance segmentation using inter-frame communication transformers","venue":null,"work_id":"37d5d280-8784-43ce-b354-4611f6bf9aaf","year":2021},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.488015Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:07e72be73ec1f71dfe9c236597d6eb91daeb1af8b41f8367b6db3b8a13bafb9e","observation_id":"7b45a9d9-c36c-44d2-ad63-e64170754081","resolution":{"observed_at":"2026-08-05T15:52:17.497831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.475427Z","title":"Video panoptic segmentation","venue":null,"work_id":"2a4e7963-03f9-43e2-a51b-ed4de28de8b0","year":null},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.492725Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:143d5a15d040dadeb99579c9c8b3113c7a4d4eb5a57478b954bbb55f7ede6788","observation_id":"4825247a-88c9-482d-93e6-d78cb83ab75b","resolution":{"observed_at":"2026-08-05T15:52:17.480792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.459189Z","title":"Tubeformer-deeplab: Video mask transformer","venue":null,"work_id":"6d277466-34b9-4b79-8760-542855f409ec","year":2022},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.497752Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:0afa478f3bbae5babd88140ac1bb803945bc4eb749e5b8a618441cc931c1ec7a","observation_id":"b8594234-570c-40c2-aac4-daf8e1bb48b6","resolution":{"observed_at":"2026-08-05T15:52:17.464204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.441674Z","title":"Visage: Video instance segmentation with appearance-guided enhancement","venue":null,"work_id":"2da625be-591c-4c43-918a-a3a9983a1b1c","year":2024},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.502950Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:f6418b85dde298d0c8440aad168a50ae9549044fadf99493548e1a6ed0e0b5eb","observation_id":"e0771a88-4d8d-4fe6-ac32-a5f5d94b833d","resolution":{"observed_at":"2026-08-05T15:52:17.447234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.420200Z","title":"Berg, Wan-Yen Lo, Piotr Dollar, and Ross Girshick","venue":null,"work_id":"170d4b09-9eca-41c0-892e-a7e54ca3b540","year":2023},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.508058Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:59d742ba4478a1ea5fccc5eb5d15d583c5a630b77754aad971fb105e16a1e238","observation_id":"1461a5e3-f4d3-4260-8759-8a302446bdf3","resolution":{"observed_at":"2026-08-05T15:52:17.425917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.399805Z","title":"Univs: Unified and universal video segmentation with prompts as queries","venue":null,"work_id":"1c3f87bb-6867-4137-9662-f63f719f36ab","year":2024},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.513868Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:b0748a109918032a3e4a80da9aa37d9c86f0977eb92903b21cb0046e17099fea","observation_id":"afc8ab21-2689-439d-b37f-0d5b105190ea","resolution":{"observed_at":"2026-08-05T15:52:17.405124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.381837Z","title":"Video k-net: A simple, strong, and unified baseline for video segmentation","venue":null,"work_id":"b8b82634-ca96-496b-a7d9-ad82cc0f8227","year":2022},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.520167Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:0559e2917959909b1bf89cd7326511cbbb538f25b7d92b29df937bf5a76729b3","observation_id":"fbd9a8f8-6014-45d1-b787-f737545eb36d","resolution":{"observed_at":"2026-08-05T15:52:17.387623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.363147Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"0a3b4c41-8f33-45e4-8575-9c128fe57362","year":2014},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.526647Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:ac2c99a4ef13b51d38b1b25aae400e6dad4c8fc6194d7c8c5ff085cc10d19abe","observation_id":"5bd90744-5653-4830-812d-1e2451df1eb7","resolution":{"observed_at":"2026-08-05T15:52:17.368698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.347721Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"d52bd108-6358-4bef-8892-f5b17bf5d16a","year":2021},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.531289Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:b4e1ef57ae04a4a8e6f828d921eeef1d56074b5ba32b6fb0795303ad485d9d14","observation_id":"51e38b0e-7f0e-4874-bb39-8c9463bf3a93","resolution":{"observed_at":"2026-08-05T15:52:17.352602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:16.536513Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.536513Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:9b07adf17bed853b3870f61e6ce123dfd4cd200a518602fd6b322d9cacedd4f7","observation_id":"891f8809-64ee-4748-857a-a44bfab5c832","resolution":{"observed_at":"2026-08-05T15:52:16.536513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-05T15:52:16.541193Z","title":"Language models are few-shot learners.arXiv preprint arXiv:2005.14165, 1:3, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.541193Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:4967213cfb6da987625ab48c127ed19d8f89899b76dc39e539a045b9faf2c49b","observation_id":"e0e281c9-c11e-4333-bc78-8b1c9d2113c8","resolution":{"observed_at":"2026-08-05T15:52:16.541193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.321218Z","title":"Trackformer: Multi- object tracking with transformers","venue":null,"work_id":"aebf03ca-c5fa-413a-82ab-1cc1bbef9bbe","year":2022},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.546111Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:4b8248d809ebe0f1c174362bb5e72b3a55082e75a5b312b0ce9b7fed261ce1a0","observation_id":"d723adf5-6981-48f6-a702-07d497284ddd","resolution":{"observed_at":"2026-08-05T15:52:17.326155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1603.00831","last_updated":"2016-05-03T23:55:38Z","snapshot_observed_at":"2026-08-03T05:59:06.882015Z","submitted_at":"2016-03-02T19:07:56Z","title":"MOT16: A Benchmark for Multi-Object Tracking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.00831","snapshot_observed_at":"2026-08-05T15:52:16.551066Z","title":"Mot16: A benchmark for multi-object tracking.arXiv preprint arXiv:1603.00831, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.551066Z"},"links":{"cited_paper":"/paper/1603.00831","citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:22c08ebb6a8caee877cd77940d91a14a70893c7068aec26af689b947f487fa4a","observation_id":"39084838-b895-49db-b5e9-23042f0ea2ea","resolution":{"observed_at":"2026-08-05T15:52:16.551066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.304838Z","title":"Videoobjectsegmentationusingspace-time memory networks","venue":null,"work_id":"3d6a3f1b-1449-48e7-a103-a13d9602aee0","year":2019},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.556170Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:1cc05f0e50b18f643dc7747f180ddbebe6f3003354be5c6e54cbee3cbc64bf59","observation_id":"96b0c5b9-0c8b-46d3-a322-5775d6c38d19","resolution":{"observed_at":"2026-08-05T15:52:17.309936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-05T15:52:16.560810Z","title":"The 2017 davis challenge on video object segmentation.arXiv preprint arXiv:1704.00675, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.560810Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:0e5fdd9291b32b3f61fe7fe2817dbd79aea63a0bd1cfcfacf4dbc8f1ed8f6324","observation_id":"ffe03473-a0b6-406e-9123-b4b74133be84","resolution":{"observed_at":"2026-08-05T15:52:16.560810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12409","last_updated":"2022-04-22T18:20:48Z","snapshot_observed_at":"2026-08-07T11:26:24.970964Z","submitted_at":"2021-08-27T17:35:06Z","title":"Train Short, Test Long: Attention with Linear Biases Enables Input Length Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.12409","snapshot_observed_at":"2026-08-05T15:52:16.566222Z","title":"Train short, test long: Attention with linear biases enables input length extrapolation.arXiv preprint arXiv:2108.12409, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.566222Z"},"links":{"cited_paper":"/paper/2108.12409","citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:626d765e5a23d6c5779a005a6d10660f227db259e49bdb0a39401dfa1becb5ca","observation_id":"17033fd4-ea4f-40b0-a618-7550bc36d650","resolution":{"observed_at":"2026-08-05T15:52:16.566222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.288112Z","title":"Occluded video instance segmentation: A benchmark.IJCV, 2022","venue":null,"work_id":"f75740e5-dec7-41b9-8eaf-305d7ceedb12","year":2022},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.571184Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:a2917ee94f13020b3f229ebf4814db1f09516a2c142883420914603dd8c4f026","observation_id":"97f69a1b-300c-4796-bfc5-f0a32e6de72c","resolution":{"observed_at":"2026-08-05T15:52:17.292854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.272295Z","title":"Language models are unsupervised multitask learners.OpenAI blog, 1(8):9, 2019","venue":null,"work_id":"03b57d03-8ef3-45a3-9e38-205fdd6edce1","year":2019},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.576816Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:481b7046a9f140e67668df327c42d0ba8f63c87ba03b44ef7a4c52be4e05e9c8","observation_id":"a27ccbf2-f2a7-4e03-9083-c16f18856fc8","resolution":{"observed_at":"2026-08-05T15:52:17.277081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.255779Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"e0ffd530-3052-4875-bdff-785cdf2257a5","year":2021},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.581668Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:05c802aab3805102e11d38e2303eeb8ef3e8502146116225f8422d3f4497de0e","observation_id":"ddc4f406-bde8-4145-93bb-a8f4f4d39be0","resolution":{"observed_at":"2026-08-05T15:52:17.261577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.239267Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":"957e49f2-0d1c-46ff-b2e8-10eaf460fa0f","year":2025},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.586678Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:e6f1b0c07d70199e3bbaa7adcb1a327162d9821c77ff86aaf1f1ebdc38de18c5","observation_id":"9cfa00d0-639a-4296-a769-b3d9dbd209c6","resolution":{"observed_at":"2026-08-05T15:52:17.244625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.221871Z","title":"Urvos: Unified referring video object segmentation network with a large-scale benchmark","venue":null,"work_id":"489884dd-35b1-445a-bbf9-d2da4a6d95ff","year":2020},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.591657Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:a27f6fe0fb153373676915561b12df74d23e401d0dabc3b2aafe15f6e2c3e598","observation_id":"5689917a-dba1-45b7-8618-18c96592be45","resolution":{"observed_at":"2026-08-05T15:52:17.227593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15449","last_updated":"2025-09-07T18:50:16Z","snapshot_observed_at":"2026-08-08T06:06:41.534202Z","submitted_at":"2024-02-23T17:25:10Z","title":"Repetition Improves Language Model Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15449","snapshot_observed_at":"2026-08-05T15:52:16.597131Z","title":"Repetition improves language model embeddings.arXiv preprint arXiv:2402.15449, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.597131Z"},"links":{"cited_paper":"/paper/2402.15449","citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:c1cd0ce27cb4a9948a13339d48ba2730de62b22123ff1b7488b7a49a8e7816f8","observation_id":"8b14a890-e01d-43b7-a6a8-ee613d1820c0","resolution":{"observed_at":"2026-08-05T15:52:16.597131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.204152Z","title":"Sequence to sequence learning with neural networks","venue":null,"work_id":"9ffcb72a-853f-460a-8629-4b996a44b8b8","year":2014},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.602369Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:606093aae37cbbb17d2fd723322e9e02d7a7277f8ee5a9c925caa08a24b51517","observation_id":"57c5c273-9677-46b0-bf01-f88a32608fa7","resolution":{"observed_at":"2026-08-05T15:52:17.209269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.186432Z","title":"Attention is all you need","venue":null,"work_id":"c354f901-717b-486d-ab61-de7ef6d681ad","year":2017},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.607296Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:69fe5777816b7788599b404807225b4f1f8eac66c8eb881197ba59704e47023a","observation_id":"58d6caf9-96d9-4f37-8235-aa98213c07f8","resolution":{"observed_at":"2026-08-05T15:52:17.192463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.169515Z","title":"Mots: Multi-object tracking and segmentation","venue":null,"work_id":"2045b636-401f-4afb-ac21-b0babdfef014","year":2019},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.612009Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:5f5180cad82cb8c38d218b6a4243aa1e3cfa5fd87a8b9995d18c5d8f30d0b3fd","observation_id":"471ab83e-d319-43c1-b713-0b7ad505bc3d","resolution":{"observed_at":"2026-08-05T15:52:17.174807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.152872Z","title":"Max-deeplab: End-to-end panoptic segmentation with mask transformers","venue":null,"work_id":"5007d75e-f602-4793-bf85-54bec4d59d01","year":2021},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.617095Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:b2e9c33407b924b642320878b5af5d8d4dd308f8a3e422b7c46ff4d1e89844f6","observation_id":"fe02fd67-d773-4f2d-8c45-b940e4c0ba9f","resolution":{"observed_at":"2026-08-05T15:52:17.158195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.135918Z","title":"End-to-end video instance segmentation with transformers","venue":null,"work_id":"c4c4f32b-1daa-4bc5-9687-04c0a77b2796","year":2020},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.622055Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:1a4b90e43e167af4696fe9bbe9acb33bd34bad4945aca72e9222876072c95558","observation_id":"1b47c41b-c718-4f3a-9541-ffefbc1331ad","resolution":{"observed_at":"2026-08-05T15:52:17.141749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.116531Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"248fd26e-322d-47e6-9573-b13961de713e","year":2022},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.627092Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:6fb79c35154e68a45148b3a55a7cb6de12bcc88c615a233ecdfd152358d95511","observation_id":"88c1a9fb-1e2e-42e3-93d4-4ee22bdb26ff","resolution":{"observed_at":"2026-08-05T15:52:17.122859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.100202Z","title":"Segment every reference object in spatial and temporal spaces","venue":null,"work_id":"6e93d4ab-449e-4d1b-ba1d-6829e080c30e","year":2023},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.632189Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:fe01b044429a4e5b6d3e14eb2ff5fc1116e99cf0ab21cd8902e046e105389774","observation_id":"54cc4cc7-8dac-482e-8275-4e8218799bdf","resolution":{"observed_at":"2026-08-05T15:52:17.105300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15715","last_updated":"2023-12-25T12:54:11Z","snapshot_observed_at":"2026-08-05T20:07:29.323834Z","submitted_at":"2023-12-25T12:54:11Z","title":"UniRef++: Segment Every Reference Object in Spatial and Temporal Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15715","snapshot_observed_at":"2026-08-05T15:52:16.637223Z","title":"Uniref++: Segment every reference object in spatial and temporal spaces.arXiv preprint arXiv:2312.15715, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.637223Z"},"links":{"cited_paper":"/paper/2312.15715","citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:6486987411adc535b8bec201718b0af60983b166f7ff2485a3672d30cf45e666","observation_id":"12536e1d-f8d0-46ec-b7a0-6669087dc48b","resolution":{"observed_at":"2026-08-05T15:52:16.637223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.081324Z","title":"In defense of online models for video instance segmentation","venue":null,"work_id":"4f744667-9e4a-4a8d-9db8-eed6f5f7e619","year":2022},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.642391Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:3b7498b05421156ffcc0fa837fa1fd030efe817a311dd8fb1828e1c231c60295","observation_id":"b8c805a8-9f0d-4803-b494-4103fd5a4c78","resolution":{"observed_at":"2026-08-05T15:52:17.086960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.062443Z","title":"Online object tracking: A benchmark","venue":null,"work_id":"01f89669-19ed-4860-aaeb-eaf9c28dbee4","year":2013},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.648003Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:06a77e84bcd007de5a63a4c7f2d9600d422d6cd48669c29ba8c9114d0967acc0","observation_id":"03fabcbb-02d6-453d-814e-9316fd8407af","resolution":{"observed_at":"2026-08-05T15:52:17.067808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-05T15:52:16.653696Z","title":"Efficient streaming language models with attention sinks.arXiv preprint arXiv:2309.17453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.653696Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:d96fc3807f994078c87cc2fa3ad0b0826639911f0e60c6668465eb2e21b49906","observation_id":"99af8edc-eff1-4366-8650-221d764ec550","resolution":{"observed_at":"2026-08-05T15:52:16.653696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.03327","last_updated":"2018-09-06T04:19:45Z","snapshot_observed_at":"2026-07-06T07:00:12.122241Z","submitted_at":"2018-09-06T04:19:45Z","title":"YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.03327","snapshot_observed_at":"2026-08-05T15:52:16.659221Z","title":"Youtube-vos: A large-scale video object segmentation benchmark.arXiv preprint arXiv:1809.03327, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.659221Z"},"links":{"cited_paper":"/paper/1809.03327","citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:64853a18a116610e94123ff49d43c88e7b0d37c17a5f48de0f93f76ce8c791d8","observation_id":"69fb682e-a55a-4b1f-acab-f281f0b2c7b8","resolution":{"observed_at":"2026-08-05T15:52:16.659221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.044142Z","title":"Universal instance perception as object discovery and retrieval","venue":null,"work_id":"93e1e113-f183-4173-927b-5cd80cecab8e","year":2023},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.664517Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:6061635321d1630f4e019d55da59856ce45b6fcc5a1cb7f88284fbf9f53444db","observation_id":"5eb3c589-7670-4912-8c20-f706e56b01f4","resolution":{"observed_at":"2026-08-05T15:52:17.050220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.024865Z","title":"Video instance segmentation","venue":null,"work_id":"4b9d4005-b8e6-4585-abc9-d01bbeb26534","year":2019},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.669522Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:c310f1701358e092dda2a146ac76d3a38f489bc9cec3e2b747584c8eba7a807c","observation_id":"41f27a09-3114-4a91-aca5-58a7a9d5f584","resolution":{"observed_at":"2026-08-05T15:52:17.030729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:17.005386Z","title":"Decoupling features in hierarchical propagation for video object segmentation","venue":null,"work_id":"e044d6c3-a99f-4ed6-af00-b9361c9600b2","year":2022},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.674355Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:8be0f92634a3e000f978588336b57fdaf55bbea58cc256e2063fe1a0bebec488","observation_id":"7ca2f19f-1bc9-49ea-b5be-af608e24fff5","resolution":{"observed_at":"2026-08-05T15:52:17.011198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:16.987527Z","title":"Associating objects with transformers for video object segmen- tation","venue":null,"work_id":"c297b7af-e38a-40fc-b04b-5610547fc80f","year":2021},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.680179Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:1f9917c13990d4bea7aad0be76d4a7f033c9825d415319c3fd9fec92953433c9","observation_id":"2e1593db-fa4d-45ad-a308-0788bd75f222","resolution":{"observed_at":"2026-08-05T15:52:16.992951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:16.970315Z","title":"Ctvis: Consistent training for online video instance segmentation","venue":null,"work_id":"a436e223-ff8c-4588-90ba-8f0d9007c6a7","year":2023},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.684828Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:450630b5756597622e543fc16cca7b96c790e76aa7fd7337e3b53a529a04e816","observation_id":"d813b1bd-be76-44b6-85a5-45ccd77f5dd2","resolution":{"observed_at":"2026-08-05T15:52:16.975710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:52:16.950660Z","title":"Dvis: Decoupled video instance segmentation framework","venue":null,"work_id":"5da4060b-8be4-4841-9f10-9a67ba2a07ac","year":2023},"citing_paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T15:52:16.689829Z"},"links":{"citing_paper":"/paper/2508.19242"},"observation_digest":"sha256:1235cede07e039d0d55fc482730eb795850ee31c457aeefbc8beb8eeb1e4ad51","observation_id":"aaf548a7-c725-4cef-932b-04afca00c196","resolution":{"observed_at":"2026-08-05T15:52:16.957792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.19242","last_updated":"2025-08-26T17:59:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T07:54:20.948687Z","submitted_at":"2025-08-26T17:59:13Z","title":"Autoregressive Universal Video Segmentation Model"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":44},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2508.19242."}