{"as_of":"2026-08-07T10:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ab0865d957796b570216cdc4afadb13562bf8510d75cbbd36d66bfc6ec6c4d8","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:16:10.475961Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:35:37.095627Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T10:11:08.927215Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"cited_work":{"arxiv_id":"2507.22886","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.22886","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards omnimodal expressions and reasoning in referring audio-visual segmentation","venue":null,"work_id":"3546df82-ca74-443b-91bf-2cdacb57142d","year":2025},"citing_paper":{"arxiv_id":"2604.11789","last_updated":"2026-04-20T14:38:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T17:55:02Z","title":"LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation","version":2},"reference_index":210,"source":"pdf_text","source_observed_at":"2026-05-10T15:35:37.095627Z"},"links":{"cited_paper":"/paper/2507.22886","citing_paper":"/paper/2604.11789"},"observation_digest":"sha256:06959624867db697171073509a0e0770f377952d5cf8ae66e3c5047b4b4ed106","observation_id":"f4afe86d-fbd3-4785-a992-0802dc92b695","resolution":{"observed_at":"2026-05-11T10:11:08.958133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.22886/citation-record","integrity":"/paper/2507.22886/integrity","json":"/paper/2507.22886/citation-record.json","paper":"/paper/2507.22886"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:06.019397Z","title":"Qwen Technical Report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.019397Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:a71b1d6a2b3f686897b3e55cddf8ee06fb6aaf7caa05941ae76ad2525af10ffb","observation_id":"1ce8bf37-9ae5-49f7-b3e4-78a3253ac6ea","resolution":{"observed_at":"2026-08-06T11:16:06.019397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T11:16:06.094700Z","title":"Qwen-VL: A Frontier Large Vision-Language Model with Versatile Abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.094700Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:3b936114258e2878c7e6a6b6b6740cb9b9caa1d3403dffec771be30a1b7e8533","observation_id":"2f00d2a4-c04b-4525-9a71-c51d555eb531","resolution":{"observed_at":"2026-08-06T11:16:06.094700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:06.158565Z","title":"One Token to Seg Them All: Language Instructed Reasoning Segmentation in Videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.158565Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:8e8d1bfded2ea8ea122350e96fe2e7cc070f6b311b7f46fd894046989a44bc04","observation_id":"a5525f58-491f-4f40-93f7-0b2218537b1b","resolution":{"observed_at":"2026-08-06T11:16:06.158565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:06.221846Z","title":"METEOR: An Au- tomatic Metric for MT Evaluation with Improved Correla- tion with Human Judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.221846Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:b6cf68890d42fc0133d00edbc3ead0179a9c94bf8f87d26a6a6c4aa14868ff38","observation_id":"022d88cb-68fc-4714-ac2f-f3c71fb547e8","resolution":{"observed_at":"2026-08-06T11:16:06.221846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:06.274355Z","title":"End-to-End Referring Video Object Segmentation with Mul- timodal Transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.274355Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:f9103deb8cb9be12c5d732dda7994dab90e07da3cc8c43d56a1d1ca82089f8dc","observation_id":"777041a2-00ee-4a1a-9dc6-3c07deffeaeb","resolution":{"observed_at":"2026-08-06T11:16:06.274355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:06.346121Z","title":"Auditory Scene Analysis: The Perceptual Organization of Sound","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.346121Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:dc0d9a9416c4f54fe4ceafa004172b1824acf4c773ab028e100c2f9d5257083d","observation_id":"e8e3eb20-6961-4062-a322-8376d74a004c","resolution":{"observed_at":"2026-08-06T11:16:06.346121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:06.422372Z","title":"COCO- Stuff: Thing and Stuff Classes in Context","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.422372Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:7003a40305af5f149df11803d1634b6e7c33d75d05562d6eff8fe9b1f633a942","observation_id":"9784a756-a69b-4dc8-8bc6-cbd6e11ed1b5","resolution":{"observed_at":"2026-08-06T11:16:06.422372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.264195Z","title":"TIM: A Time Interval Ma- chine for Audio-Visual Action Recognition","venue":null,"work_id":"e5860a46-7b3f-4648-adff-e4546a859971","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.485367Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:eaf22ab7734f7aca1c3c581d1b3c763fea9fd12b286aa009ed3915da1c3b5554","observation_id":"e53caa16-5819-4119-b0bd-d8051b52809f","resolution":{"observed_at":"2026-08-06T11:16:12.269880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.244250Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","venue":null,"work_id":"9585622b-4b6c-4152-b939-2142c9d8af3b","year":2021},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.596129Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:ff843e51f8ffc81eb8a9e9c80c70a63bf2ea95217b39f3ede5027496ff0a9dbc","observation_id":"c505fc3d-73be-4808-9367-b907a3ce0dc7","resolution":{"observed_at":"2026-08-06T11:16:12.252941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.227550Z","title":"VGGSound: A Large-scale Audio-Visual Dataset","venue":null,"work_id":"61223182-198f-4e12-a0e6-c269a50f30fb","year":2020},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.636040Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:b8c5cb8bbbb64703eda8977e08493ac75a2a01cf7fc46cc403afa75b251d37ac","observation_id":"1ae1bae4-45c0-424a-8d2f-ee1031106421","resolution":{"observed_at":"2026-08-06T11:16:12.232394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.204532Z","title":"Detect What You Can: Detecting and Representing Objects using Holistic Models and Body Parts","venue":null,"work_id":"68a6bfa6-923b-4ef5-87cc-648eede9d3b8","year":null},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.696935Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:a9d83b8f7de549c93e9fe5d11ec76cb9a2fffb0e58baa29e1c9d6a65db96425a","observation_id":"042946cb-fc4c-4e03-a6e0-73db51bb935a","resolution":{"observed_at":"2026-08-06T11:16:12.210671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.185435Z","title":"Vision Transformer Adapter for Dense Predictions","venue":null,"work_id":"327a3c0a-a1f6-4f96-8b93-ed714faf23b3","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.774702Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:93159acf3dd663e1de4f1684fe4f582060de2d4ac7c00316db33cdff78770542","observation_id":"646c8340-d9cb-4d95-8eeb-802e3e114d5e","resolution":{"observed_at":"2026-08-06T11:16:12.190592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-06T11:16:06.856376Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open- Source Suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.856376Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:744945c1835212af5f6e30656a6356b864d8411a22422bbe3abbb97adf24d914","observation_id":"76f515e9-2c19-402f-a1c4-383e0f99abb1","resolution":{"observed_at":"2026-08-06T11:16:06.856376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.163651Z","title":"Masked-attention Mask Transformer for Universal Image Segmentation","venue":null,"work_id":"dac5a460-98e8-4081-bf28-1e0b5c60607e","year":2022},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:06.974243Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:2faaa0ce1c1ba7ab348979070df342c0fcf9942540c2c584be4880866fb91dd2","observation_id":"1e824bbf-bee8-4cc9-9ad0-a5e34c2278c8","resolution":{"observed_at":"2026-08-06T11:16:12.171004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T11:16:07.045271Z","title":"VideoLLaMA 2: Advancing Spatial- Temporal Modeling and Audio Understanding in Video- LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:07.045271Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:09caab5b006e7220763e024c5290b65bc4418ab686cafe6b4cfdd4a880fc418b","observation_id":"e2e4208a-25f8-4a3c-bd42-3fac05f3a85d","resolution":{"observed_at":"2026-08-06T11:16:07.045271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-06T11:16:07.101084Z","title":"Qwen2-Audio Technical Report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:07.101084Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:1d95d64de773b92cf7ee900e46116fe71d7d6002de0e9834d4886d551edbeaa5","observation_id":"b10fd106-834c-4e6d-8b7b-ad7c8fdc633b","resolution":{"observed_at":"2026-08-06T11:16:07.101084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.144175Z","title":"MeViS: A Large-scale Benchmark for Video Segmentation with Motion Expressions","venue":null,"work_id":"a3a908d7-d9c7-41ec-9e42-2ed7ecf775bb","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:07.286988Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:8d1299ec0e1eaae823f655fe958e4e09513650252669bc0f2833145dc1cf9bb4","observation_id":"f6258804-80df-43ff-9a14-46e88b13db52","resolution":{"observed_at":"2026-08-06T11:16:12.149630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.122874Z","title":"MOSE: A New Dataset for Video Object Segmentation in Complex Scenes","venue":null,"work_id":"865bc83c-0b11-4a20-a009-f35bdda825ff","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:07.373963Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:3e08dc82b39b98fa5679aff58af8cf0c6ad8975cbfa4d7f25e0dc65a851e3add","observation_id":"01f7c39d-536f-4319-b801-04d6ef0370b8","resolution":{"observed_at":"2026-08-06T11:16:12.128980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.104295Z","title":"Multimodal referring segmentation: A survey","venue":null,"work_id":"c1c0a513-cdbf-4d68-aabd-b6035e8c577a","year":2025},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:07.468288Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:018d634bf9c4b8e74cfc1c14b10502f4817a60e0d5b17a970c87c86da56608bb","observation_id":"4f1abf28-9b01-48f0-80fc-2db69cc2c347","resolution":{"observed_at":"2026-08-06T11:16:12.110276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.082613Z","title":"MOSEv2: A more challenging dataset for video object segmentation in complex scenes","venue":null,"work_id":"e63ae1ed-d1fb-44f5-977c-c7905c0cbe7f","year":2025},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:07.555289Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:d7249baf9016b1dd2218d0263eb6ec8582ccad46ed7e84b151568c3ee52cda59","observation_id":"6c58ef9c-39ad-43f1-91f7-91a7b233dcde","resolution":{"observed_at":"2026-08-06T11:16:12.089024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.064668Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","venue":null,"work_id":"4c699fa7-69dd-493b-a529-759b4039da3f","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:07.614968Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:8af6813a868bb8b171a6d8d4b9effa3b321669179884a0c6bc19c429db5f2d35","observation_id":"a47ca59b-9d8f-4b35-bf3b-54d1f65feaf9","resolution":{"observed_at":"2026-08-06T11:16:12.070253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.046728Z","title":"A VSegFormer: Audio-Visual Segmentation with Transformer","venue":null,"work_id":"5338f4ec-126e-45be-a570-c88b42ae0826","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:07.702971Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:38c02945f9cafb4997e1e3cf6a1ca85c5452d300c2e6acee24b8f51c5038d2bf","observation_id":"48a5fa52-7c80-4b18-8b04-ac3a66fa6e90","resolution":{"observed_at":"2026-08-06T11:16:12.052365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.028417Z","title":"https://github.com/RVC- Boss/ GPT-SoVITS, 2024","venue":null,"work_id":"45566f8e-3b2f-4d85-96e2-22b876a851c5","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:07.890555Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:bcbcac462a8ec7ff5df34fffbb9f86654e800f31ae66ecfe86a03c3a654e3a49","observation_id":"4dd43122-d005-4916-bbd3-36838b48a4d8","resolution":{"observed_at":"2026-08-06T11:16:12.032935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:12.011472Z","title":"Open- V ocabulary Audio-Visual Semantic Segmentation","venue":null,"work_id":"abacee87-9f67-4038-bdb9-390fd5463d71","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:07.963845Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:42e9d2e778bf1ad2f1b61484194e960eebd4db2af1abb4e25889da813053b5ee","observation_id":"405c891e-2575-4736-bdea-30422574e22c","resolution":{"observed_at":"2026-08-06T11:16:12.016780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.990687Z","title":"Multi- modal Instruction Tuned LLMs with Fine-grained Visual Perception","venue":null,"work_id":"c75b9059-45ba-4440-8606-ed000079e546","year":null},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:08.053343Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:c0bbb7b6075d120334de1c3ddba33434268d7e7271647bd42c60285d148ad1a5","observation_id":"2807b96b-cd94-4504-a8de-d82e0c18893f","resolution":{"observed_at":"2026-08-06T11:16:11.996594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.972601Z","title":"Decoupling Static and Hierarchical Motion Perception for Referring Video Seg- mentation","venue":null,"work_id":"cc557f5c-cb91-4553-8be9-d105741de624","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:08.146958Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:5371595b6b1f8e262ae16ebf2117dd3f6389ed3e8f1c85d355507010e5735955","observation_id":"1371932c-7134-4480-abe1-c9c9ad800365","resolution":{"observed_at":"2026-08-06T11:16:11.977821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.953818Z","title":"A Generalized Framework for Video Instance Segmentation","venue":null,"work_id":"9f0f3b2c-35ca-4dbb-bd90-d15536413ceb","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:08.229361Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:2a66fb984d16551047de890bfdb7339576de6d7edce96c5206ea2b1e902dad24","observation_id":"f6c70001-9a2d-426c-ad4f-06a8182e72a6","resolution":{"observed_at":"2026-08-06T11:16:11.959155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.933775Z","title":"Deep clustering: Discriminative embeddings for segmentation and separation","venue":null,"work_id":"4afee058-4064-40ae-a37d-37b7153615e1","year":2016},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:08.279887Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:9c87faa6f89d311334d6d844ffa793c1a2ab219fe0ea854565843689885f9d7f","observation_id":"cd2dc9d9-8f31-40c9-a458-3c397f3283c0","resolution":{"observed_at":"2026-08-06T11:16:11.942633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.916960Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":null,"work_id":"dc71d0d1-88f6-4544-92df-0052aef561f0","year":2022},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:08.397805Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:8ad9487013263a5f8c1427eaa541766eea9971c79d8b59d9c413524ad17a4ec2","observation_id":"db461c65-20e1-4067-a559-4ffe04388662","resolution":{"observed_at":"2026-08-06T11:16:11.922008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.900979Z","title":"Egocentric Audio-Visual Object Localization","venue":null,"work_id":"8787ebbe-fa8f-4729-928a-a1f3f367f1c9","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:08.609708Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:2e2e9ff10e61bdd37ed461c4b3923df7d4b48db2dc1ee0e868810115d5d40e7e","observation_id":"d1af3745-296f-45f2-8d5f-9cc30daa77ac","resolution":{"observed_at":"2026-08-06T11:16:11.905791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.882347Z","title":"Video Object Segmentation with Language Referring Expressions","venue":null,"work_id":"024039bb-b0c7-4e1b-a56a-433a2e4440dd","year":2019},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:08.667631Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:ff016934ac57ed4c8b8380613481cb4305a425a5050cdeac48c0b9e8fc05663b","observation_id":"50a7f8a0-b7c0-4f1b-9ca8-a92f7895044c","resolution":{"observed_at":"2026-08-06T11:16:11.888913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.864446Z","title":"Segment Anything","venue":null,"work_id":"d9d7302f-4869-421e-acde-b828aff74bc0","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:08.752455Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:56022761ce8c8f66c5d066ca67a0c933d68c67c06c6cf76d6720a41f5ab12388","observation_id":"672b7acd-ee7b-4197-8a0b-e39f025dd6dd","resolution":{"observed_at":"2026-08-06T11:16:11.869618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.849117Z","title":"LISA: Reasoning Segmen- tation via Large Language Model","venue":null,"work_id":"bd9a60e2-4d9a-4f29-8bb9-de16c3c0c430","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:08.844260Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:90b0ae79e3b68be4f775706658224e9e0590ddd92a6282da2344e9aac508051b","observation_id":"e8dc9a84-77ca-4455-8bb8-8e76388a25f0","resolution":{"observed_at":"2026-08-06T11:16:11.853787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.832508Z","title":"TVQA: Localized, Compositional Video Question Answer- ing","venue":null,"work_id":"ab2253d8-3db0-48c8-b236-f167614b13a7","year":2018},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:08.989571Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:fe5417e01ac80b7930e0a78496900207a5b1b7b6cc07f658b3a4f9c90bbcecdb","observation_id":"64d9a684-9cda-4be5-9d2a-d1b0722f00db","resolution":{"observed_at":"2026-08-06T11:16:11.837725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.814295Z","title":"Learning to Answer Questions in Dynamic Audio-Visual Scenarios","venue":null,"work_id":"bd84b7f4-923a-4e64-b7f4-1c3cc70eca27","year":2022},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:09.133635Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:72e5bbf6944dacc09a89ffca7055df312a9f88f709a4ba8411bb5e5f913b36b2","observation_id":"f176f74b-fda8-43ac-901b-0ec06487a5e0","resolution":{"observed_at":"2026-08-06T11:16:11.819872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.794817Z","title":"Boosting Audio Visual Question Answering via Key Semantic-Aware Cues","venue":null,"work_id":"cf4a61d8-05fb-4484-99aa-34f543cdfffe","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:09.261515Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:528e642f41aa22ab2c175db1b3297e3eba32527a7ede54466fa3f3cf933c0be2","observation_id":"f8a8afd9-e3f0-4389-9471-37c213797fff","resolution":{"observed_at":"2026-08-06T11:16:11.800716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.777376Z","title":"Do Audio-Visual Segmentation Models Truly Segment Sounding Objects? arXiv, 2025","venue":null,"work_id":"eee27644-e65d-4060-a297-c651cbe09cc8","year":2025},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:09.423301Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:e896c551e8f6457780065fe052f453ff938ef6b454278472ee54e8e01f8e23f1","observation_id":"fcccefce-30db-4420-a1eb-d1a5452bf3e4","resolution":{"observed_at":"2026-08-06T11:16:11.782524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.758236Z","title":"Robust Referring Video Object Segmentation with Cyclic Structural Consensus","venue":null,"work_id":"483b99cf-60cb-4b32-a613-bbb0eb99727a","year":null},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:09.565012Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:fa5e24fb8114480dbd9d79457c8d5176f7d85d5ad22c279821f93135c1a52832","observation_id":"645602e0-6408-4407-97dc-4093b00fe8fb","resolution":{"observed_at":"2026-08-06T11:16:11.764123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:09.667789Z","title":"Baichuan-Omni Technical Report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:09.667789Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:6df77a51d76ebcf890b6e3812eab393227edc32dc4f8b33dd126664155dc357b","observation_id":"c8b02ec2-3a3d-4696-8be3-73d21c9be3ea","resolution":{"observed_at":"2026-08-06T11:16:09.667789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.737816Z","title":"Losh: Long-short text joint prediction network for referring video object segmentation","venue":null,"work_id":"270b88b5-ba58-4bac-85c2-6f17f0222408","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:09.765828Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:ee5f578309b90f0cb833e83598f9de45956f6e05960ed0d6cd41404fd7948169","observation_id":"d5aae2dc-9bb8-440b-9bc7-5ff61ddce81d","resolution":{"observed_at":"2026-08-06T11:16:11.743164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.720071Z","title":"GRES: Generalized Referring Expression Segmentation","venue":null,"work_id":"7b9c8722-6508-4cc3-ab26-da4db10a3ad4","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:09.891803Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:e4832134f801f3d113bfd46b071c4a26ef79b7fe079c76033f5b112349c6576b","observation_id":"50923f62-0614-498b-9011-7e18564c6710","resolution":{"observed_at":"2026-08-06T11:16:11.725625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.700028Z","title":"Primitivenet: decomposing the global constraints for referring segmenta- tion","venue":null,"work_id":"a1dd13c9-13fe-40de-952e-db89f328304b","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:09.973694Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:d63a6e2afb572a6e15a1585fc0419cc2d1dd67d04a17d7af488b66ef4a4fda31","observation_id":"891931f1-a7d3-4608-bc87-9c6f7b102264","resolution":{"observed_at":"2026-08-06T11:16:11.705305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.683587Z","title":"Visual Instruction Tuning","venue":null,"work_id":"f92692be-07c4-405d-ae45-d2ecc8793a99","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.155107Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:60d693f72277d9ed58b0cc967f3ea0c92bfbfaceb1602d257045d7d259f12a32","observation_id":"bdfc6c6f-d5ba-4b18-93c0-8dfbcddcee92","resolution":{"observed_at":"2026-08-06T11:16:11.688159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.667385Z","title":"Improved Baselines with Visual Instruction Tuning","venue":null,"work_id":"6399a87b-7b3b-4e7d-860b-badb46ca228d","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.204533Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:caa0f672d040f565c1513d886ddf057d1207e4f9bb0cddeef1268ccebc8f0e9c","observation_id":"1590031a-698e-41ca-b72f-fa229f64fbbc","resolution":{"observed_at":"2026-08-06T11:16:11.672272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.649271Z","title":"ConvBench: A Multi-Turn Conversation Evaluation Benchmark with Hierarchical Ablation Capability for Large Vision-Language Models","venue":null,"work_id":"4cc2f249-a140-44a4-b554-d84aa26621d7","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.210803Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:9eed62c5dc6ded5d7e26075c03dc04b486343de59adca498e5c63f55a9f9514d","observation_id":"10ab099c-43fb-47a7-a078-5903e288deae","resolution":{"observed_at":"2026-08-06T11:16:11.654463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.629838Z","title":"Conv-TasNet: Surpassing Ideal Time-Frequency Magnitude Masking for Speech Sep- aration","venue":null,"work_id":"51dd85dc-d2ac-4816-a7be-97453724d515","year":2019},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.217190Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:f1d45bd726ce553259223f45c571de93e6e629b7c716b1ca36d7d54caf0a1f1f","observation_id":"8abb241e-01d6-4491-9e08-383ddf8654f1","resolution":{"observed_at":"2026-08-06T11:16:11.635223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.603638Z","title":"Stepping Stones: A Progressive Training Strategy for Audio- Visual Semantic Segmentation","venue":null,"work_id":"36a47bf0-c811-4abc-94ae-58c77e2b954e","year":null},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.222759Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:cbcb4dd40c862f1e3fdae3f6920355fcd5ea3a768f9c9b75fa277baf9931107c","observation_id":"015e1808-5f00-4085-98c3-22a9a3013810","resolution":{"observed_at":"2026-08-06T11:16:11.610896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.583186Z","title":"Generation and Comprehension of Unambiguous Object Descriptions","venue":null,"work_id":"0ec69d2d-83bb-4065-ac70-b95d180ed060","year":2016},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.228825Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:3bbb066141c15b5d5054f60a23b486dbf7fdffdb416a052eb8ec6ca534941788","observation_id":"9a25fee9-c7ce-46fd-a42f-0e562430d94a","resolution":{"observed_at":"2026-08-06T11:16:11.588517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.564522Z","title":"V-Net: Fully Convolutional Neural Networks for V olumetric Medical Image Segmentation","venue":null,"work_id":"bb8ed346-e857-4a5c-896c-d89591e6f03c","year":null},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.234547Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:481cc5b83889b0700418e39ff321c7146dc92f4110baa3768134e42d1a8ddbad","observation_id":"0501c317-ebcf-452a-b993-8c1f8f8b4d2c","resolution":{"observed_at":"2026-08-06T11:16:11.570411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.545857Z","title":"https://platform.openai.com/docs/ guides/text-to-speech, 2023","venue":null,"work_id":"207a668a-7b31-451b-b8c7-f7135b82018b","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.247239Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:3d0589df26d68a76b329cebb493a041614e40c9b790097f14aeb13d77aab6d14","observation_id":"6cbd765e-9f01-4245-a1ce-0c1c298c72f3","resolution":{"observed_at":"2026-08-06T11:16:11.552583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.529073Z","title":"https://openai.com/index/hello- gpt-4o, 2024","venue":null,"work_id":"0616f6a6-499b-4f02-b852-67a5bb800c92","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.252563Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:10a5c7d31cbe1f320a4654a5ee8cf0cb4b071102bff054f87d60c7cf3e81c714","observation_id":"82d8109d-93ff-4236-b5d7-e40bc2dcf588","resolution":{"observed_at":"2026-08-06T11:16:11.534588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.510965Z","title":"Wnet: Audio-Guided Video Object Segmentation via Wavelet-Based Cross-Modal Denoising Networks","venue":null,"work_id":"9ed4d22d-f760-4f18-8aa9-41fe37ec9ce8","year":2022},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.260334Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:2eae466f544fd4a7437db0f4a88c8a65926240ca91c93b99bdf753dfc9b97639","observation_id":"6a185d90-b484-4179-baa4-a6d681f6e7b2","resolution":{"observed_at":"2026-08-06T11:16:11.516684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.492750Z","title":"DetGPT: Detect What You Need via Reasoning","venue":null,"work_id":"7adad704-5d87-412c-bb80-baa97af639cf","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.269021Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:3a71316e2c959cf6e226ebf7d4dd3fc6b1bb180c5a0b862479796ac6e09359b8","observation_id":"1b467605-e0aa-40c9-bc9c-023ef0f3f312","resolution":{"observed_at":"2026-08-06T11:16:11.498976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.475532Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":null,"work_id":"eac8be49-6255-4883-a5b0-c87bc054bdc9","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.278238Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:f41882bfef95c290c0ba5309e24debb3da1868d14e94477b27a960702c3b39bc","observation_id":"cbcbf9cf-d2f6-449e-bbdc-68cfc1239e0c","resolution":{"observed_at":"2026-08-06T11:16:11.480708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.428499Z","title":"PACO: Parts and Attributes of Common Objects","venue":null,"work_id":"df65ac26-c907-4f97-a4f4-74a18fc7d76f","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.285742Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:5e03bfc918cf01176b72d566754b6a6b05171abb8db6462e27299c09b2686a7b","observation_id":"c563c37b-4b53-45a7-be18-589aece25f6f","resolution":{"observed_at":"2026-08-06T11:16:11.444625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T11:16:10.292503Z","title":"SAM 2: Segment Anything in Images and Videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.292503Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:e6d4e6f1b4723df510661311c9bbe28faac1f9fa9b43dada78c0196f483df501","observation_id":"6e4bfd0c-8c92-4dff-ba5d-033188d7a457","resolution":{"observed_at":"2026-08-06T11:16:10.292503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.384151Z","title":"URVOS: Unified Referring Video Object Segmentation Network with a Large-Scale Benchmark","venue":null,"work_id":"e17b6758-167c-45ae-bb14-fd9cde3b3ee5","year":2020},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.298834Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:2000c7d63e046abd570787b2e0b8d23a24a50310503b1b425d9e000903002a60","observation_id":"00c96345-f537-42d2-996d-8d48ef230711","resolution":{"observed_at":"2026-08-06T11:16:11.405620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.360012Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","venue":null,"work_id":"3d17541d-eb82-4d0e-a65b-2cb85d2723cf","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.304319Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:8ad2e2e50b946e799e2a58a9737da5e037cbc88d5f00a50fa44472f45d2b530b","observation_id":"ec9d5370-ca5d-47a2-a75d-17e77bc45517","resolution":{"observed_at":"2026-08-06T11:16:11.364909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.341313Z","title":"Auto- ACD: A Large-scale Dataset for Audio-Language Represen- tation Learning","venue":null,"work_id":"cc078adc-2d20-4567-a649-dedc4700fa11","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.312650Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:8504fad410186f7f0c8d088e3374dd5e8ae2a2ed5bb515e31271b3448be368b9","observation_id":"43f66742-91dd-46ec-8af0-56562b948142","resolution":{"observed_at":"2026-08-06T11:16:11.347843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.323242Z","title":"Unveiling and Mitigating Bias in Audio Visual Segmentation","venue":null,"work_id":"49234a64-8554-4f2d-98a3-7e16a2a0d5dd","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.319486Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:1f73858d707dce64d67f759a618ac9014c7636b4c910dd8790dce88e8578d18c","observation_id":"e9f020c3-53c3-4b7e-9352-6abb95a70ee2","resolution":{"observed_at":"2026-08-06T11:16:11.330373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.306646Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","venue":null,"work_id":"abbb3b14-6329-4ee4-8946-c0997a178cb5","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.324756Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:a58c90d37d653fdcb91b2f2de9ae5af2f3918197375e62c2ebcce33941889a3c","observation_id":"10441679-27b3-40d4-ae73-4bb067d5a7d8","resolution":{"observed_at":"2026-08-06T11:16:11.311783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.284720Z","title":"Audio-Visual Event Localization in Unconstrained Videos","venue":null,"work_id":"cc3b9277-040f-4c82-8058-31281b0a9a0c","year":2018},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.330368Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:395735e6b848b5ad8e9592ba843323a10e865311ffcc59026a14e125d47f8e61","observation_id":"d62a2be0-8151-4f94-8b91-b354b07c882c","resolution":{"observed_at":"2026-08-06T11:16:11.290558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T11:16:10.336496Z","title":"Qwen2-VL: Enhancing Vision-Language Model’s Perception of the World at Any Resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.336496Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:5cc456e1d68dfc7664aaa0da5a2abf6162ab829d710265097e32100265eb1270","observation_id":"2d7d6602-7a14-4756-bee0-279c1d915fb5","resolution":{"observed_at":"2026-08-06T11:16:10.336496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.265737Z","title":"Audio-Visual Grounding Referring Ex- pression for Robotic Manipulation","venue":null,"work_id":"f6552051-0f92-43d2-93e3-34447b076383","year":2022},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.341868Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:d866efd7883b3ec7b26e8583614f3d1a6e9e2de4ea4345371355d27496552117","observation_id":"9dc3b0b3-a9e6-4331-bf5a-a7eaa1d6b5cb","resolution":{"observed_at":"2026-08-06T11:16:11.271327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.246498Z","title":"Prompting Segmentation with Sound Is Generalizable Audio-Visual Source Localizer","venue":null,"work_id":"1be8f3fa-4716-4198-9b20-360fd027b3e4","year":null},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.357613Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:37f5777aaffafabc499dbdd7f88b581347359b9bcdb4c555c22d1e116932bfb8","observation_id":"244a95f7-f82a-40e5-9e11-73152644fc18","resolution":{"observed_at":"2026-08-06T11:16:11.253156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.229609Z","title":"Can Textual Semantics Mitigate Sounding Object Segmentation Preference? In Eur","venue":null,"work_id":"2284c9e1-5ddc-4b35-a385-448e4c51053a","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.363089Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:b1f7ae68497bb62183ff9bd4c97abd861cb074a01729ace38e9ebbef0a667f03","observation_id":"977b99c5-f402-4b6c-a997-dce4e653e001","resolution":{"observed_at":"2026-08-06T11:16:11.234846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.212665Z","title":"Ref-A VS: Refer and Segment Objects in Audio-Visual Scenes","venue":null,"work_id":"a99ddd33-7dfb-4792-87c2-b5f9bb277f6f","year":null},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.369265Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:fe1f9b2c1d7815ce1f9f0335745274084f27d43cad798b3133bde039174bd6fc","observation_id":"631e99e6-604d-4d89-ad36-31efa91f39f7","resolution":{"observed_at":"2026-08-06T11:16:11.218188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.192123Z","title":"Language as Queries for Referring Video Object Segmentation","venue":null,"work_id":"f555fee2-d58f-4cc5-bb76-723a144b8488","year":null},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.374194Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:c0f1b44288fc83fb48212abd29b307a0290ed1428063f0c9f34cc20c7b25b81e","observation_id":"04473527-a83e-40a6-811e-0b61852742e8","resolution":{"observed_at":"2026-08-06T11:16:11.198186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.165129Z","title":"VISA: Reasoning Video Object Segmentation via Large Language Models","venue":null,"work_id":"509a3bf1-c626-4773-a1be-0e8dad1089cb","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.378825Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:ee98f8ea050bb530f19d9126efb92a903f55ec18a1562fb3d344533e435d579c","observation_id":"777ad773-26d4-453f-8f81-38b7847d8705","resolution":{"observed_at":"2026-08-06T11:16:11.174877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.140387Z","title":"Referred by Multi-Modality: A Unified Temporal Transformer for Video Object Segmentation","venue":null,"work_id":"90770f14-30f0-463a-953a-d4ace953e9d5","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.387330Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:75921330989ab1a5a659d0a20c5da02922023ca37c027ac14575b3ef2b9e1820","observation_id":"8116845e-6924-4180-b5be-c901cef114e4","resolution":{"observed_at":"2026-08-06T11:16:11.146807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.112585Z","title":"A VQA: A Dataset for Audio-Visual Question Answering on Videos","venue":null,"work_id":"626fc5bd-1774-49a6-b91b-16a012dee3d9","year":2022},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.394479Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:950c7c06e68822f49340e8648eef4f2fe61ff60cc2670a9171b3433ee17af0ff","observation_id":"46080188-6cf1-486a-8db9-15479764098e","resolution":{"observed_at":"2026-08-06T11:16:11.121804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.089229Z","title":"LA VT: Language-Aware Vision Transformer for Referring Image Segmentation","venue":null,"work_id":"63448ef3-b633-49a6-bd45-e5e51447de9b","year":2022},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.399323Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:42b21276377433643922245c653e127e2e01f71b0b0448658683211f995ad93a","observation_id":"d1978e52-dd29-4c52-b280-80f4a309769b","resolution":{"observed_at":"2026-08-06T11:16:11.095686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.060007Z","title":"Isda: Position-aware instance segmentation with deformable attention","venue":null,"work_id":"070b027c-203e-4859-8bb3-1a851aa96429","year":null},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.409682Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:3ece1ca30c9ba22b0fba2ddb3bca92f697b239978b056f1c109f77acc6e754e3","observation_id":"95031c31-a3e3-417d-93f3-0937d2a67d77","resolution":{"observed_at":"2026-08-06T11:16:11.064986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.038924Z","title":"CTVIS: Consistent Training for Online Video Instance Segmentation","venue":null,"work_id":"57664890-4b8d-4426-86e5-30d739220e24","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.414531Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:059d132eaf6eab4c3d8baf9750040aaa8a09fa4685dfacbb4e565e5b68117b3c","observation_id":"585b8fae-a251-4094-b1d6-05e743ac25d6","resolution":{"observed_at":"2026-08-06T11:16:11.044795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:11.011988Z","title":"MMT-Bench: A Comprehensive Multimodal Benchmark for Evaluating Large Vision-Language Models Towards Multitask AGI","venue":null,"work_id":"821befa2-f732-418a-9e23-706ebce26947","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.420373Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:f9461c6e92a29f306898744b2a977ff88beba770f63c6c8733ab4a0a52cd2203","observation_id":"4478e543-28aa-49f9-8f7f-66ef2796a7c2","resolution":{"observed_at":"2026-08-06T11:16:11.017438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:10.985525Z","title":"MOVE: Motion-guided few-shot video object segmentation","venue":null,"work_id":"1fe29a91-0ed0-4ce2-bfbf-f646a9e6b290","year":2025},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.425968Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:9e8188211d928e26da62dd3d50b87e3230bb4b86b33643ce9deb5f31e78b89cc","observation_id":"4abbf53c-1812-4652-8e2e-20332cfcfee0","resolution":{"observed_at":"2026-08-06T11:16:10.995052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:10.958770Z","title":"Modeling Context in Referring Expressions","venue":null,"work_id":"92c7170f-3c04-4426-ba29-9d2be309db8a","year":2016},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.430262Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:affba71652da646754b5d453d4dd2c90cf8dd02eb1b459389e63bf53129075ff","observation_id":"e239833f-6bb0-4853-bbd8-114595adcdeb","resolution":{"observed_at":"2026-08-06T11:16:10.964609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:10.935072Z","title":"MOTR: End-to-End Multiple-Object Tracking with Transformer","venue":null,"work_id":"b6a8e903-f804-46f9-9dd0-dd0518d50cc4","year":2022},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.435156Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:3f6873346395360b7c99aa061a163c160de5bca2ea5dd1682eca3eed072b391e","observation_id":"3f0d94cf-bbe8-4685-8d81-ca5875f7e677","resolution":{"observed_at":"2026-08-06T11:16:10.945246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:10.914662Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","venue":null,"work_id":"b1d3cda9-9b3a-4ce9-bd79-e63f2ee6131e","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.439995Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:c8b92c8add1641449302472e5d12c76f1443883025769bd2ab9ffbfee355c40c","observation_id":"ae1f22c0-d178-4c3b-ad7c-2f9fcd04f24e","resolution":{"observed_at":"2026-08-06T11:16:10.921392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:10.896877Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Large Language Models with Zero- initialized Attention","venue":null,"work_id":"1dbdf236-28be-4d99-8ccf-0498905dfaad","year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.444754Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:532faba1c420983c7f6d035a3223f230af6773a5d26fd78b00f857b5d1f0dcd6","observation_id":"60db074e-da48-4dee-ac7e-11891f91c7ef","resolution":{"observed_at":"2026-08-06T11:16:10.902176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03601","last_updated":"2025-06-12T00:15:18Z","snapshot_observed_at":"2026-08-06T08:24:07.376776Z","submitted_at":"2023-07-07T13:43:44Z","title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03601","snapshot_observed_at":"2026-08-06T11:16:10.449340Z","title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.449340Z"},"links":{"cited_paper":"/paper/2307.03601","citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:95835df1256c03432b6db5e9cdccdadcd02fab0cc8b5c9210cf77b41629ede88","observation_id":"a24455e6-9922-4a95-9d94-7a0c5ac81fa1","resolution":{"observed_at":"2026-08-06T11:16:10.449340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:10.880288Z","title":"DVIS: Decoupled Video Instance Segmentation Framework","venue":null,"work_id":"0387cd5a-a892-4133-89b2-99c8457bd109","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.454902Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:285d947afa324ea22a50da27d6ecfa3422bd6c84a55b4115a6af85d00fcd8f0c","observation_id":"3dd6e515-9ec8-43cd-987f-fa1c1d08a13f","resolution":{"observed_at":"2026-08-06T11:16:10.885373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14500","last_updated":"2025-03-16T14:39:54Z","snapshot_observed_at":"2026-08-03T02:01:04.625797Z","submitted_at":"2024-07-18T17:59:17Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14500","snapshot_observed_at":"2026-08-06T11:16:10.460552Z","title":"ViLLa: Video Reasoning Segmentation with Large Language Model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.460552Z"},"links":{"cited_paper":"/paper/2407.14500","citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:31cfb040ba876d4e91e05a12c1f83cc4ebfc33931b6f374af0d5bcc888d5d00a","observation_id":"f35ef5b4-7b2b-4406-9312-0d74b021a834","resolution":{"observed_at":"2026-08-06T11:16:10.460552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:10.863800Z","title":"Scene Parsing through ADE20K Dataset","venue":null,"work_id":"6b2b581d-da8e-49f0-9e15-9035161bb942","year":2017},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.465447Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:4aeef1f080271e6e0a2c390f6541661f4c13953f781a860deefefea6f20df4b4","observation_id":"77a47579-e561-4dec-99a8-67aeadf588f5","resolution":{"observed_at":"2026-08-06T11:16:10.868533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:10.848020Z","title":"Audio-Visual Segmentation","venue":null,"work_id":"7811d815-8eea-41c8-90f9-9b4b607710d1","year":2022},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.470620Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:c70a196e93a6728e6591c11caced482ff95cf6454635c53e5d759fb0affb5aee","observation_id":"b4440455-5ce6-4e3d-bcb1-fdbf7fc961df","resolution":{"observed_at":"2026-08-06T11:16:10.852538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:16:10.824615Z","title":"Tracking with Human-Intent Reasoning","venue":null,"work_id":"8cd8ccd9-4ae0-454b-9ae3-6d6bd7786169","year":2023},"citing_paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T11:16:10.475961Z"},"links":{"citing_paper":"/paper/2507.22886"},"observation_digest":"sha256:4cbe0f29d052e56da722c1466897ed4eec62cbd579b92fc7e45e924c89bcd8f6","observation_id":"68aa03c1-fccc-480d-9709-0703fb587fc1","resolution":{"observed_at":"2026-08-06T11:16:10.832815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.22886","last_updated":"2025-07-31T03:28:53Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T11:16:05.211724Z","submitted_at":"2025-07-30T17:59:31Z","title":"Towards Omnimodal Expressions and Reasoning in Referring Audio-Visual Segmentation"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":71},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 1 inbound Pith citation observation for arXiv:2507.22886."}