{"as_of":"2026-08-08T04:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b47c3f714a00531f5b1d01eedb2965348ab06ba802bab03bdf430a106f1139b","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:29:29.724751Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T01:50:54.242508Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:55.213452Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"cited_work":{"arxiv_id":"2506.02356","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02356","snapshot_observed_at":"2026-07-04T15:09:55.213452Z","title":null,"venue":null,"work_id":"bc275eef-9f90-45ce-b9ab-4b955923ff38","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2506.02356","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:846544d7afd40b3568cbdabb5dda24e670bdd9c57444352e61ff58db10287970","observation_id":"66f5d8ba-b7bd-4887-b54e-b3e839842af9","resolution":{"observed_at":"2026-07-04T15:09:55.214944Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02356/citation-record","integrity":"/paper/2506.02356/integrity","json":"/paper/2506.02356/citation-record.json","paper":"/paper/2506.02356"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:34.179535Z","title":"One token to seg them all: Language instructed reasoning segmentation in videos","venue":null,"work_id":"6f02f332-cb9c-4f73-a526-c2719dc65a76","year":2024},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:27.623640Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:80c12d81433fab84e0cb9cb542cf2599a27561637401bb0bae2fb135dd26a791","observation_id":"dee763a0-162e-4fdf-803b-272cdbdf7042","resolution":{"observed_at":"2026-08-07T11:29:34.253558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:33.958931Z","title":"End-to-end referring video object segmentation with multimodal transformers","venue":null,"work_id":"931ea38f-7073-4091-a04f-b82c4a2f058c","year":2022},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:27.674228Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:b4bafd7d4b2fed3a11615dcca0bf04eac41c344f0d4edfc87ba57c789d3211ef","observation_id":"85184742-8ac3-4641-a574-aecbcd50b8c5","resolution":{"observed_at":"2026-08-07T11:29:34.057605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T11:29:27.777419Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:27.777419Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:dfd0bb66b693a791a29ee6ce82e9c17e2b128148df854f58136809e5febd2253","observation_id":"5a381820-99cb-45bc-9192-783b00a298f8","resolution":{"observed_at":"2026-08-07T11:29:27.777419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:33.776737Z","title":"Vision-language transformer and query generation for referring segmentation","venue":null,"work_id":"bc2b0c07-907f-4327-a778-3472acfbf3d6","year":2021},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:27.834762Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:5110d0524b1ace9a4729ae4caff300f5cc6e42487d8dabbef1af988db77f23fe","observation_id":"9368ec74-88b7-4f2f-a2c8-0c690f01fbda","resolution":{"observed_at":"2026-08-07T11:29:33.862292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:33.564577Z","title":"Mevis: A large-scale benchmark for video segmentation with motion expressions","venue":null,"work_id":"2cb716b5-c0ca-4b5f-a4f8-e8a041393e4f","year":2023},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:27.917308Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:0b1df32a94e361625fd7af20315c812cf62b4526d679f67b8e000561c3935f0d","observation_id":"baae64bd-df07-4a70-b212-5abaec036c7b","resolution":{"observed_at":"2026-08-07T11:29:33.640172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:33.368559Z","title":"Moma: A multi-object multi-action dataset for understanding human activities","venue":null,"work_id":"062e3551-995c-482c-a035-5fd074a51ae1","year":2021},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:27.989653Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:f86455d5f103db0327e52f2be3320336ee1ea95dcc43255d3c373ff27487abef","observation_id":"b91dbc1a-cbb9-4d1f-aa8b-a8e0ac7e1dd8","resolution":{"observed_at":"2026-08-07T11:29:33.410861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:33.250907Z","title":"Actor and action video segmentation from a sentence","venue":null,"work_id":"1ffab4f6-ba9c-4c3c-bce1-5e8c3af08547","year":2018},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:28.076797Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:1486582657e935d5ad603c4a4e6e38e98cd73ee2d918cd2aa415047e616d5535","observation_id":"bf4a6e33-31c5-4bfb-ad76-b6f4018096bb","resolution":{"observed_at":"2026-08-07T11:29:33.306269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:33.040716Z","title":"The llama 3 herd of models","venue":null,"work_id":"b5ce2729-c9a9-4dd7-8872-e6f067f697f6","year":2024},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:28.133567Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:9a41ab9ce011d5222cda8a6f63ef33f0ec6d11832ccafb980ea68e938e837791","observation_id":"52848177-7ddd-4880-9b09-00a850dcaec7","resolution":{"observed_at":"2026-08-07T11:29:33.101988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:28.190322Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:28.190322Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:7daf9b52812d31598c1ffa3a53fd84f65ccba1f9b5d2ea4fd4ea8aade5798f55","observation_id":"f51f17a5-0d00-409d-b20a-94e1e8dfbb97","resolution":{"observed_at":"2026-08-07T11:29:28.190322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T11:29:28.254083Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:28.254083Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:78362abd7e795eb68f92e150fcb258da4689921074c1e1dcf1c089422e417cd0","observation_id":"82a39cc5-de55-4213-afa2-c3f0483ebaad","resolution":{"observed_at":"2026-08-07T11:29:28.254083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:32.799594Z","title":"Action genome: Actions as compositions of spatiotemporal scene graphs","venue":null,"work_id":"1add1d07-9b8d-4ae4-a923-458c0ad4ac1d","year":2020},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:28.343745Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:cedcdcc5706d59e31ff460f58ef51e8b57d359a43a14ba7a25098bbaa195fc4b","observation_id":"5ad1d67c-d91c-4f6d-a940-9f0cc036ade9","resolution":{"observed_at":"2026-08-07T11:29:32.908278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:32.526475Z","title":"Video object segmentation with language referring expressions","venue":null,"work_id":"9f57ba29-765f-4802-b228-3e4b86f47cdc","year":2018},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:28.412310Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:f8d2cec383458ae6824b3a3f9b74f1937720933c82b0a6c3b959c7e67ea5bdef","observation_id":"86063e0b-4cee-4535-af7a-e12a2afdbae7","resolution":{"observed_at":"2026-08-07T11:29:32.619250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04923","last_updated":"2025-03-25T10:08:13Z","snapshot_observed_at":"2026-08-04T02:03:57.818642Z","submitted_at":"2024-11-07T17:59:27Z","title":"VideoGLaMM: A Large Multimodal Model for Pixel-Level Visual Grounding in Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04923","snapshot_observed_at":"2026-08-07T11:29:28.478864Z","title":"Videoglamm: Video grounded language-image pretraining with masked modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:28.478864Z"},"links":{"cited_paper":"/paper/2411.04923","citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:94566592dbfbd68734c62a6624a2bec07e91e013793f19980a0bf77d5512adbc","observation_id":"3c42c50f-28d6-4f2a-a0c1-5d2179bed05c","resolution":{"observed_at":"2026-08-07T11:29:28.478864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:28.562199Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:28.562199Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:44ff65fd7cafa4c49609d929e93f3fd57ee2eefc1e3f7f7b3f8852a324c9bf0e","observation_id":"9dd12239-b4e5-43e3-95f1-eab0bf2524d0","resolution":{"observed_at":"2026-08-07T11:29:28.562199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:32.290188Z","title":"Spectrum-guided multi-granularity referring video object segmentation","venue":null,"work_id":"c9f1d01a-17aa-4e4a-8b02-0f7d7bc2f745","year":2023},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:28.655247Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:83395ce351eeec15e501ebb296fc154930b907c0df9eda8128fc9171ed9f6ba1","observation_id":"b8e90b91-2bcd-4c5a-b288-d8694652df00","resolution":{"observed_at":"2026-08-07T11:29:32.416144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:32.054619Z","title":"Refer-youtube-vos: A dataset for video object segmentation with language referring expressions","venue":null,"work_id":"11c363bc-08a6-4cb1-b55a-1c9717751acc","year":2020},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:28.718185Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:fbc674fecbc4734a26dd61d634cf2a30cbe9a702dfb6c889bf8525720f131a7b","observation_id":"945be114-8625-4e57-9bbe-9fc57529e925","resolution":{"observed_at":"2026-08-07T11:29:32.178119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T11:29:28.763180Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:28.763180Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:527efffeb4d4c46ab69b13b80467c677e7c6e0ab9b688eec59fbc053b8c64072","observation_id":"80d7bdab-9f61-4f66-a496-b15b3a3355e5","resolution":{"observed_at":"2026-08-07T11:29:28.763180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:31.702267Z","title":"Urvos: Unified referring video object segmentation network with a large-scale benchmark","venue":null,"work_id":"426ede42-8ce7-4de1-9bbe-4facc4135a59","year":2020},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:28.841080Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:8be1c718c561f6d74f01cd76d4d7e3b0bffe7efa47bb9431d9011b10e8987321","observation_id":"db77b5ba-1be2-4a7a-9791-269ea4c563db","resolution":{"observed_at":"2026-08-07T11:29:31.861439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:31.333232Z","title":"Video relationship detection","venue":null,"work_id":"6061614a-aa57-45e3-a181-a22d5d196f76","year":2017},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:28.914632Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:0747dbb594c55290372bf9b9eb4e32dfc58de42cabe8a2c1fe71335f0e098f37","observation_id":"2aa89ca2-753c-40bd-b9e7-699f0531a945","resolution":{"observed_at":"2026-08-07T11:29:31.474955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:30.966195Z","title":"Annotating objects and relations in user-generated videos","venue":null,"work_id":"843b32aa-aefe-4899-9590-3e9953038620","year":2019},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:28.981295Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:4518b6a978a6ab996c90f9ebdec079d95a490ed874ced278763b96af6e3d9149","observation_id":"71050332-79e4-42da-8df2-789af37553ba","resolution":{"observed_at":"2026-08-07T11:29:31.094806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:30.745459Z","title":"Yfcc100m: The new data in multimedia research","venue":null,"work_id":"1b1e2bbb-359f-48b6-8cf5-4ba0f551684a","year":2016},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:29.039012Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:e845b47cacb05b18f941531f6c45bb3d752eb5c7e0b97566524ae546438884fb","observation_id":"e30af10b-5310-4e50-a02a-6535d18e2ab7","resolution":{"observed_at":"2026-08-07T11:29:30.865552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17011","last_updated":"2023-05-26T15:13:44Z","snapshot_observed_at":"2026-07-06T15:34:01.658872Z","submitted_at":"2023-05-26T15:13:44Z","title":"SOC: Semantic-Assisted Object Cluster for Referring Video Object Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17011","snapshot_observed_at":"2026-08-07T11:29:29.102921Z","title":"Soc: Segmenting objects by categories for referring video object segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:29.102921Z"},"links":{"cited_paper":"/paper/2305.17011","citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:d69de8137bf90b33d36f411f556e6baf60865e322a2a124b842e13ed95df79a1","observation_id":"5cb9c047-76ec-408a-8c66-0f6c3378604a","resolution":{"observed_at":"2026-08-07T11:29:29.102921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-07T11:29:29.149297Z","title":"Villa: Unifying vision-language segmentation tasks with large multi-modal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:29.149297Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:0719a8c21ecafb3641d9bfe87bcbf17f275662a3a5544d0376c331176581bf54","observation_id":"51c3e5c4-7511-4120-a3b2-65b765c8c9b2","resolution":{"observed_at":"2026-08-07T11:29:29.149297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:30.554264Z","title":"Language as queries for referring video object segmentation","venue":null,"work_id":"1f8308fa-e5c8-45d6-9dfa-5dfb8314f74b","year":2022},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:29.205824Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:10ace87b1c054049a453886b971c637a07884c858e2c47f8787a7e9699c97758","observation_id":"e701675b-9556-4572-b972-89f1ac135800","resolution":{"observed_at":"2026-08-07T11:29:30.644265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09711","last_updated":"2024-05-15T21:53:54Z","snapshot_observed_at":"2026-08-03T10:25:11.936842Z","submitted_at":"2024-05-15T21:53:54Z","title":"STAR: A Benchmark for Situated Reasoning in Real-World Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09711","snapshot_observed_at":"2026-08-07T11:29:29.288871Z","title":"Star: Structured action understanding in instructional videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:29.288871Z"},"links":{"cited_paper":"/paper/2405.09711","citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:c5c6fb4749a21593b55432590affadfef0de4290f6e44ea2308883542445f6e0","observation_id":"759cfd64-7b93-4d6e-9e2e-1b9fa7556250","resolution":{"observed_at":"2026-08-07T11:29:29.288871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:30.423132Z","title":"Visa: Reasoning video object segmentation via large language models","venue":null,"work_id":"d686bd5a-0dfb-499a-b66a-98622529288d","year":2024},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:29.323770Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:b394e000f9eb086bc0a372e01dfb733c5d2262772674afa2760664f073772fa5","observation_id":"3efc5d46-5ba5-4ef7-8314-11c0529b260c","resolution":{"observed_at":"2026-08-07T11:29:30.477138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04001","last_updated":"2025-11-03T17:35:29Z","snapshot_observed_at":"2026-08-08T01:58:42.644918Z","submitted_at":"2025-01-07T18:58:54Z","title":"Sa2VA: Marrying SAM2 with LLaVA for Dense Grounded Understanding of Images and Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04001","snapshot_observed_at":"2026-08-07T11:29:29.406573Z","title":"Sa2va: Marrying sam2 with llava for dense grounded understanding of images and videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:29.406573Z"},"links":{"cited_paper":"/paper/2501.04001","citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:3c910a79cc9e7e03e23468c3fe11dbb71160069fe1118d5d9089b658d8606ff5","observation_id":"651c05f3-96ee-4b49-9b2e-fae4fe859f67","resolution":{"observed_at":"2026-08-07T11:29:29.406573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03645","last_updated":"2024-04-04T17:58:21Z","snapshot_observed_at":"2026-07-06T17:55:49.302964Z","submitted_at":"2024-04-04T17:58:21Z","title":"Decoupling Static and Hierarchical Motion Perception for Referring Video Segmentation","version":1},"cited_work":{"arxiv_id":"2404.03645","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.03645","snapshot_observed_at":"2026-08-07T11:29:30.106190Z","title":"Decoupling Static and Hierarchical Motion Perception for Referring Video Segmentation","venue":"cs.CV","work_id":"f8c04d34-5d62-4f11-92c1-792b75484953","year":2024},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:29.474932Z"},"links":{"cited_paper":"/paper/2404.03645","citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:bff9b36c114fcb0744cc2ed9f03d2825ea347939bca4f383910b12c2ef80093e","observation_id":"f2776946-a890-4711-adbb-6403f95f64e9","resolution":{"observed_at":"2026-08-07T11:29:30.142164Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:29.534945Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:29.534945Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:a1ab4cb0703e5848e04c3d0c434ec9236def6d12c14d8991cc68f4c9f3715750","observation_id":"9034104e-4cb4-4125-b42f-18ec53fd65aa","resolution":{"observed_at":"2026-08-07T11:29:29.534945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:29.594298Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:29.594298Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:b4666ef46d4c323781404fbe5424632039daff025b76d26411be0c4d834448f2","observation_id":"1d30c372-044f-4464-b690-037358a9bc37","resolution":{"observed_at":"2026-08-07T11:29:29.594298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:29.642842Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:29.642842Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:ac808c53ead722f7498e2ab040e21b2a8cc7ecbaae32d28a7c1cfe527f628203","observation_id":"c13ea854-4ba4-4081-8f51-25305ab4c2b2","resolution":{"observed_at":"2026-08-07T11:29:29.642842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:29.724751Z","title":"A child helping another child with a backpack","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:29:29.724751Z"},"links":{"citing_paper":"/paper/2506.02356"},"observation_digest":"sha256:63db45a2b72a1fe3055ec4e1d27ad425c81346ca17597c87682593f1b7ddeb13","observation_id":"ce1d1cc0-77ce-4bad-b412-6a3faf66d064","resolution":{"observed_at":"2026-08-07T11:29:29.724751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02356","last_updated":"2025-08-18T07:41:54Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:23:17.120513Z","submitted_at":"2025-06-03T01:16:13Z","title":"InterRVOS: Interaction-aware Referring Video Object Segmentation"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 1 inbound Pith citation observation for arXiv:2506.02356."}