{"as_of":"2026-08-08T12:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bf74a5b579642811e8d4a2b119b3233969cada55c540d4fd6f19fd241be7abcf","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T06:06:47.233814Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.02922/citation-record","integrity":"/paper/2607.02922/integrity","json":"/paper/2607.02922/citation-record.json","paper":"/paper/2607.02922"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2303.08774 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:cab55ab83effe59f11b0843d96c035e1d63fa5ee6c95cd25f447fb5f66f09b3c","observation_id":"d4f6b78e-f922-41b3-abab-2b27e0411ec9","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:1412.69801412(6) (2014)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:cd1acc7a5af46078fb136ea25c9e1d2240f6d170cf9e3cbff70fb2d020aeb6f5","observation_id":"fd14e178-fc05-4119-afee-5954dfb61084","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"Machine Intelligence Research (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:27673c99f6672d24282ee04f7b6f875837d47142cb7a30ae29cae31c3df5e8f3","observation_id":"a731ca61-a436-431d-9f5e-44dc3a6c75bb","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"Machine Intelligence Research (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:3830526eec3b25d64a5d4769abfdd8d8c15e4b9a52670e3e9fd9faf7c40def6e","observation_id":"b43e701c-f674-426e-b1be-b193255ae447","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2308.12966 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:6777fdc301742d3b13b78b187a97a33d06eb3bdf9d3a6e2c70c957f0be08523f","observation_id":"a985ebc9-90f4-4304-a321-f9f016748f5a","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: NeurIPS","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:9388f4b71320aa5212c8eb1dcfabe1ce7fd5e6881d9173d954c9cea9e5f8b981","observation_id":"e9344be0-e3fc-440a-bf3a-297b14c07ac1","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:1308.3432 (2013)","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:8e093f153e43ab2bbce0b588935cc8c0edb27ef0182933ac1fa740854411e2c9","observation_id":"43e53513-0d5a-4527-b976-2a3b4b884d8c","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2210.09461 (2022) 16 Hesham et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:d3bf29884e6798ac0e57869f106eb0641db65ef137d3adad32b0765702c9cfac","observation_id":"286409b6-3575-4587-9819-987bf083cbab","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:e193fcc314f3351a5d5c65771c0e331586220be79e65ddb0e9914ceb4a3df14b","observation_id":"49536b96-5fe3-4f53-82ea-8fa6a26f86de","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09626","last_updated":"2024-03-14T17:57:07Z","snapshot_observed_at":"2026-07-06T17:44:45.924645Z","submitted_at":"2024-03-14T17:57:07Z","title":"Video Mamba Suite: State Space Model as a Versatile Alternative for Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09626","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2403.09626 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2403.09626","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:065d2b30dbdf23e42ce4d6c1b3cf237cfa304d0e47a89bea9c8f2b865689823a","observation_id":"60d65879-347f-4703-ae19-0bdd6bbc6dad","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ECCV","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:81a150413b697ee5ea09b1afd584cfe59d764a410b7afd68e3ca0fd5d64524c4","observation_id":"2273dcbc-1b9f-4414-873f-eea92e22b690","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-08-05T14:57:53.592979Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10188","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2408.10188 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2408.10188","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:7d30d5c50db71a7694044b1a7c9deedefde9433c3fd1a2fba8f5ae26fe75fb8f","observation_id":"e5a4a78c-c2e6-4cd1-b2a9-ad8f673a58f8","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2312.14238 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:82024db53b895e2cd935ca6d287574310dfb16b1c072c8410d3aa794e0941786","observation_id":"ee914331-38a4-4e45-bce5-deeb1d576497","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2406.07476 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:c5eb2ad7cf0fc7850988982d3a032750505e01214be94e5cfd9bf080b1e72d06","observation_id":"2428d069-2089-40df-9b83-285c6c5ecf9e","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2405.21060 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:0686314e8b68ffa68e2a642582ef4877d1668c5061a6666869c4ab9c370d33a2","observation_id":"7c353ec4-af22-4fbb-a93c-8a486d8cfdcc","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ICCV","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:7e486983b637afddbcdd25408b6606f9d33b826889379a0d6c4e3a68ff4ff575","observation_id":"d83652dd-aaa0-4204-acaf-6e0c470f5855","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:831bf692d6a0ca4ea451f3405607695250ace6ed464b3f44128c06e694856ab6","observation_id":"86b087dd-01bb-4cd4-a2dd-e66afb5d88c4","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv e-prints pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:bede8b7c03aa5de42e3fa81a67ed1cd42ad255b63f496aeb01a96f5cf17efb04","observation_id":"f6cd77ae-5788-4da2-ae8e-044d04b1e68c","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"Machine Intelligence Research (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:df865cc625c03e8f6d31caef4748e97d894199e5926d2e6a7bf7c6fa02bb5d5a","observation_id":"58980e28-8142-4b70-ada0-6d47a6e9d725","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:9736a373e92b6961007ce521d23d8f917894be2efdbf53f40831b9bbef1acc09","observation_id":"839d4958-a5a6-42d6-90d3-5e302b800bc3","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:d727acf66618ba7126c3d9ef60aa3dec436718005f2c78d5a1c6252515effb7c","observation_id":"28d79346-3a6e-4693-ba8c-432a47844da1","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: First Conference on Language Modeling (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:792ad73344689ca8390b374664a9cda2b53124cf7ab3000745a2e3c291244571","observation_id":"6d6050d8-1e45-4a09-b003-b4fc68496778","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: NeurIPS","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:43715070e4539e2a6a916bc1aed6f320ba4f4b7ca053c7beea4d69dfc7650fb2","observation_id":"cf3a40f1-d2d0-42db-a3b5-6523e2ea6d9c","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2111.00396 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:30a808947e4335dfd1c9a30e82cadcc28b66afb8f2b1ec4d982dd868d6fd4f07","observation_id":"13095465-ae21-4a06-a09f-14e954dfa0d5","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ICLR (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:7c017c4979f3aac56fc91041d1666e53d31443cf0ba4c2b10c16243c2e5d5e47","observation_id":"39dc3970-31d6-4ab3-8225-8dac56440536","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: NeurIPS","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:7bd741ec03b902f4d44a5ccca603a397757a3575ace5d6bf5e92aa7f9b488ca2","observation_id":"8be4e71c-fc84-401f-abc4-486ced89d171","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: NeurIPS","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:e9c705117a9bef0dc26be254ca74f63f75f479e8a976220dae215d456cee3c99","observation_id":"7f46380b-9f22-48d3-85d4-b3e7202a9ec6","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"Machine Intelligence Research (2026) STAC 17","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:a6fc7434459eb0c0d6b9aba66504a8819401feda652b1c738259388f98af599a","observation_id":"91864828-bab9-45e9-9bf7-a21edaed84d4","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:5df073fa64bc9523cdf42d10a418b05abbe086015783759ab2771e2bdc8fa03a","observation_id":"0b37b6cf-bf96-4d8b-b8d6-9dacca63d7c1","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ICLR (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:b3ddf6a8e604376b1f9d3a8e8cb7f1258a6ca0b62da1f3ab61287455faf65ad7","observation_id":"5f7d59a9-f7df-4e15-b2c1-8a903d976df7","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:fac64c776ab69b921444023e6d2019cd4ffbe49c831c3f7d90cfb7169811f2fd","observation_id":"66d601ba-6c07-44d3-af1e-3ff8c8562a84","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:311914830a5b07aa7bf7faccc44545e6db53b2bda956296202eb0c9bb8e66a1a","observation_id":"5434a24e-294f-4761-a24c-9514f4e5b6b0","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:1c7e2ea89d663d7edebb5348887794e9c0a5ce36f5b8728f26fd944a3e2d9dc2","observation_id":"f8435b2d-3802-4302-800f-b4156d23f27b","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv:2401.04088 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:a26863bea56e562552519c945536ca4b0c370cc7ab952209fd6db1dca8de972b","observation_id":"d95f45dd-7816-4adb-838a-ccf224d39e04","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2503.04130 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:9f684e11980a7747596668fde95a0db07922adad09f0b6cc0fe0531c200a4bd3","observation_id":"cb8fd7a6-1ec7-4bec-a92a-cc179f284e2d","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"Journal of Basic Engineering82(1), 35–45 (1960)","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:b99606054c21a7ed5ef83930595e8f0b06ad872e38a1b863a15418ae245dc03b","observation_id":"b6c65628-7cc4-42a5-80d4-65265b56df39","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"Computational Visual Media11(3), 655–667 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:28f21c3803cd7f1fa14e768f3d54e72b33ec31b240a263086fbe2a39f4cd4db8","observation_id":"461e5042-f45e-45f8-8ec3-bbba9c00e7e7","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: Asian conference on computer vision","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:1780fee229b9f22745edb66b3a3f8d0e87d47018903ae097e7eccffa99b6b587","observation_id":"07d234a6-566e-4f88-aab3-4927bb33ded9","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ICCV","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:da5d0bc721979caaf7e3ee4dcac89bb87ad632aff74c356fd17876ca861a737e","observation_id":"ad9c4785-e53e-4274-88b2-db8d0ad6a5df","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ICCV","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:60e125e02fbd6bdfde5b499297cf1c910f86bb98832ad045d516d3aea21081cc","observation_id":"50c01312-37ba-4f83-9556-43bc100d8206","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:9087e5cdd8b6f8209d26b42cd27c9cd68b658879e398674add607a89c55e23fa","observation_id":"44799c7f-5fff-4b2c-ae49-e3e226033daa","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2408.03326 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:a18a21b475fef17862904c91b1de3704fe178a6cb021c301d511941b54bea123","observation_id":"1a136f9a-79bc-4341-a9d8-7663fd96a47c","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ECCV","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:217e5fc66a093205341b4f659a5217d3bd706957ae88622f0de04f80dabae184","observation_id":"3be3c91e-b7b6-44b9-98fe-723c075550cb","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:9dbcbcd0fa810d46591abf413069b4bf4a5d2a3702aaf95b9698e5bf9f89d590","observation_id":"52ffdd98-43f9-447a-9a6b-11525769d7f8","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2311.10122 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:0f317fc4fce6e32e8fc5611d928e76b5bd10cd40baaddc766a7a432455d8925e","observation_id":"0aa1c8bd-29c0-4fc9-9186-2e06fef0cd9d","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:c1ab69cddd75c35793b51758b8a5eb20a3304a096eb331cf90764be1055cb220","observation_id":"fca6b943-2e8b-4f21-8027-042bedadfe68","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:2f11d0edc85ad00e9b51fedaa88296620eea899766136e5951148378d60109af","observation_id":"19bdcc5a-64fa-4aae-a66c-1a1086274fe5","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: NeurIPS","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:431e9fe28893e87464009a5da27a49fb816f644ba096d52339d357b84f8c8156","observation_id":"e73b5dfc-90ce-4da9-bcaf-296b92770c4d","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"NeurIPS37, 103031–103063 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:9b7c78df5fc4f649e3988d91420ddd09ec06bd9a69046d960c74bd2bd4830ef2","observation_id":"fdd9ddd9-0a28-4f01-9f4d-50e2fbfc5cdf","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"Machine Intelligence Research21(4), 670–683 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:e0018ff07fe7701ffd1fba2a641eabe8764bbbcfdc61276cc81ddcd231f3d08e","observation_id":"d14f4efd-bb8a-4503-ac09-5e79097118ee","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv e-prints pp","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:1bee0d3d064f0efb5e9737bd8e03cdcede87fa41948565613b7dbbfd6b223e3a","observation_id":"7b2ce9c1-ab38-4dd4-ba6f-2c5e01d42977","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: NeurIPS","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:33b7a0ec2bc22fa05916440f82bcab9dfd704e98c1e1bc8f6716e48a0aec62fb","observation_id":"fe4f295d-3fd1-4abb-9653-153300840e30","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: Proceedings of the IEEE/CVF Interna- tional Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:047368cec03882e2b6be2d43a35381ff302443032b9ed544fe8eac26e882dcc0","observation_id":"a216cdec-57c7-42b8-b8f9-1d092d8cb6a7","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:8d19fe97dfa8968d5e6db40a0a83a95e9e0a4a2d039b165471ebee7486de396d","observation_id":"a02ea75c-7acd-46fc-861e-5f796ca732c7","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"Computational Visual Media12(1), 71–84 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:b3e4efbfc55a47cf7cdaa60297411f42158b0b988c150377b2507d36d039db20","observation_id":"3ce13bc8-a305-4cf6-b2b4-3c4e22d205cd","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: NeurIPS","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:b1c055bc98d8f561391495db59630bb4ae6c28172cae251287d51abda5320fbd","observation_id":"e57e284a-daf4-49c6-8eb7-e0d902de0f7a","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ECCV","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:d7b22461619197cd2a3858ba0679be603197693055d3eb644d21edb5f20086a5","observation_id":"ce403898-ed40-42f8-a75f-c14eccd175b4","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: AAAI","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:9980f0e9e4674c335a3ca5574bf60e0ba8d42d7a46ba1ce337d34792a3e4abcd","observation_id":"99e6b471-2162-4ab1-a085-5dd6ecea0bf9","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:1704.00675 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:86e74bd507c6ea7b5c1829c848cb44b1d2b9483c9db8fe415aa2c99a5613fdd9","observation_id":"e5a10d60-7622-49ec-be24-312751ef4129","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:33e38bdb71d5f7d557027f026f6386f0ccfc6999a8c9c680598a9444f2f24591","observation_id":"75917728-ec17-4d9f-a731-f863bc70975d","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: NeurIPS","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:7dd3567751fa1de310c46caeca2b62adc557a937c977bf17ba045d5aac8e42f1","observation_id":"6575c041-ef40-4a1d-a2bb-b7e44731f92f","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:bd937e579505b0e6ea208b328dfe75a5d557bdab578fdad0774e4e4611d462bb","observation_id":"622741c0-e100-44a9-9d93-a76f3c5d7186","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2408.00714 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:1f1d58fc2958abcd627a2bd70b63ff207d286455f2759b126896ce0bf73db161","observation_id":"20f518b8-8b32-4cc0-9ed3-94ebeef0aa29","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ECCV","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:634db6e94cd886ee5958311f8bd6a24347af5cc3bc77886d095ae7511e4ce823","observation_id":"702d9478-8f9f-4295-8b22-b14605d92368","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01156","last_updated":"2025-03-12T09:11:37Z","snapshot_observed_at":"2026-07-06T19:09:14.628371Z","submitted_at":"2024-09-02T10:42:30Z","title":"TempMe: Video Temporal Token Merging for Efficient Text-Video Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01156","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2409.01156 (2024) STAC 19","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2409.01156","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:fe7ad09f7795b5f45ccb69ef177b9a426d2d12f4c862429102cee03c2ccd338c","observation_id":"54e0cb18-43af-407f-b79f-dc31dac84aca","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2410.17434 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:35ff0da67bdce32a079d9601000a2471480d32bb319edb2d22c3c57d0c1936d3","observation_id":"6b9a8a68-1aca-4181-a66f-ff7e7e52d9f7","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:405de065fdab41082b83a7a8429f778b4bbe80844f23fd63a29d962ffdaee37c","observation_id":"b695f4fe-31ef-4978-bec3-337a0f1036c8","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2508.04369 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:2c0b4c88c4b9689cdeadc4c779b80f7059be8f2fff1c6084521e84a493058e8d","observation_id":"c2dab446-ef64-436f-a05f-c75209fd2426","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ICCV","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:d4ba7cdc465e3a0fac5f3d7c1645c2f57110d6bb192d1c0d34ea346c2a48b011","observation_id":"dac7d91b-fe0b-4f15-b4be-493fd14a03ee","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2312.11805 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:d34e397d9f7efe383c693ffed3ee0d0faece613680d9d6a375c95464fd807e3b","observation_id":"7b85d7d3-ee20-421a-84cf-f9c4bade943e","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2302.13971 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:a71dc21d4749c9227472807371c2f6547559814749c901dbd9f7f79d3710dcfc","observation_id":"1a80582f-508d-4f15-9231-5a4d7d6deb9c","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv:2307.09288 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:ffad15f3f6b701310b59beba63788abaf2cb08ffc3ed97c284c6b4a406cb2fd1","observation_id":"cbb240cc-5e93-47cc-9801-319ebd9e1b52","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:30056d6c136ee557f095db4956f98b5725bba05418ca7228db4b31656670d222","observation_id":"7189ef69-2297-4e59-a673-1eb616517dc2","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"Machine Intelligence Research (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:228a65789bc1a4c5b34475e721b8f53bba62ede58ad980bf9150cc304a41cf2f","observation_id":"73e56558-2548-4938-968d-0b83975b64fc","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ICCV","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:39c9a7759d72208971a049f64e82d53da5436067f982962e3b3968478d9b4304","observation_id":"c4f5f634-8189-4261-afb8-f4f95487a011","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:ee60aadb1747edd91c57b2a51cdd47355b87c1ba4aa0ec3c83bb7fae1c2243b5","observation_id":"b8a6e547-2ca3-4297-a687-b5c140103a6d","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.03327","last_updated":"2018-09-06T04:19:45Z","snapshot_observed_at":"2026-07-06T07:00:12.122241Z","submitted_at":"2018-09-06T04:19:45Z","title":"YouTube-VOS: A Large-Scale Video Object Segmentation Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.03327","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:1809.03327 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/1809.03327","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:1ea47c4a24d0e58e7dadcfa00137b797b3cbfb3112c4f23cd1655e71f5bd9602","observation_id":"ba25135d-c025-4de1-b363-f149987afac8","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ECCV","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:ae586561cf863d6ba18c851ccb6528efc07c99205d60bb4b24accdfd92a9b094","observation_id":"b10c7c05-e02b-4bea-8777-3fdf15331f2c","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14168","last_updated":"2024-08-01T15:56:43Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:27:03Z","title":"Vivim: a Video Vision Mamba for Medical Video Segmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14168","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2401.14168 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2401.14168","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:88423929d8436b453a9fd67e545a5bd2e993e49ea0cdd15a4231004611f34b10","observation_id":"7ed5a5f4-7b5f-4753-8be1-b4a8a65b32ec","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: CVPR","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:cb9323623d2a66e4ae6b3540e2c3669dbeb05a8a7ec4f6610354d7105167a780","observation_id":"290f63e8-2ef4-48ad-aabc-29890a19ab04","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-08T01:58:42.644918Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2501.04001 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:0b512823de4121ba8e1a001d28b44bee111d8458b3d95b2f64e442d43938c5e9","observation_id":"f05d300c-997b-450d-ab5b-ea4fbd2a9409","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: ICCV","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:94c741c4fd0ca61c1f41df538c54b3305f6408a60790170325fc6bf1d7585a4f","observation_id":"33889bac-850f-4aeb-bee4-9b6d824e4b2e","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2306.02858 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:34205aa2fc96a844971d3dfa97e6ab0a6cf723edb05ff26fb6fdaf1cdf74276d","observation_id":"8989a9ea-f1ed-4eb1-8c16-26734c29cd64","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"In: AAAI","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:bcd037a01479118fe45b940f1d2b7c741f67032702a57f6dec400ce2593df152","observation_id":"e369217a-d568-4ef6-a4b4-d63108ace0bb","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17448","last_updated":"2023-12-29T03:22:18Z","snapshot_observed_at":"2026-07-06T17:09:37.286128Z","submitted_at":"2023-12-29T03:22:18Z","title":"Tracking with Human-Intent Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17448","snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":"arXiv preprint arXiv:2312.17448 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"cited_paper":"/paper/2312.17448","citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:008ecc44db78de4100ab46279079fadf20f44163f01ceed10bf8d4eb35559fed","observation_id":"8314b72e-9a63-4657-acf5-cebd372b1211","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T06:06:47.233814Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-12T06:06:47.233814Z"},"links":{"citing_paper":"/paper/2607.02922"},"observation_digest":"sha256:e5a2b79eace7d662ea5ab46fd178908005f607854f87315513f0e2280bb4c261","observation_id":"796b549c-8f3b-487a-87dc-907d78ce2ac4","resolution":{"observed_at":"2026-07-12T06:06:47.233814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.02922","last_updated":"2026-07-03T03:28:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T15:29:32.761069Z","submitted_at":"2026-07-03T03:28:25Z","title":"STAC: Selective Spatiotemporal Aggregation and Compression for Video Reasoning Segmentation"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":86,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 0 inbound Pith citation observations for arXiv:2607.02922."}