{"as_of":"2026-08-08T12:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:80831bb23692f012e99f6b321f27c4d2c593e422d5ed537797a3cca4356c30bf","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:20:47.097341Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03264/citation-record","integrity":"/paper/2608.03264/integrity","json":"/paper/2608.03264/citation-record.json","paper":"/paper/2608.03264"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.146991Z","title":null,"venue":null,"work_id":"43ef3038-8f9c-4806-8ec3-ff725e9ce0e8","year":2020},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.968366Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:b4b30532103a48135ae712276c9f811057ce4967913512f489275c811213cbc7","observation_id":"eaa25535-711e-4f3a-a769-6c44d2416505","resolution":{"observed_at":"2026-08-05T22:20:48.149983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07517","last_updated":"2023-10-11T14:15:25Z","snapshot_observed_at":"2026-08-06T00:08:08.825506Z","submitted_at":"2023-10-11T14:15:25Z","title":"CM-PIE: Cross-modal perception for interactive-enhanced audio-visual video parsing","version":1},"cited_work":{"arxiv_id":"2310.07517","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.07517","snapshot_observed_at":"2026-08-05T22:20:47.858073Z","title":"CM-PIE: Cross-modal perception for interactive-enhanced audio-visual video parsing","venue":"cs.CV","work_id":"a8a645df-eb54-454f-a5c4-3b783853821d","year":2023},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.971471Z"},"links":{"cited_paper":"/paper/2310.07517","citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:06c073465e0f30b5ce63768a9a46d674535e506bff5cc019d691452267d05280","observation_id":"d729942d-0a84-41ae-945c-c632c2dc21ba","resolution":{"observed_at":"2026-08-05T22:20:47.861590Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.137617Z","title":null,"venue":null,"work_id":"fa611a5e-ab28-4a37-9eb4-f1d100c73f3b","year":2024},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.974945Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:514439e983289c2fbd1d707af48c9819fc0523d5d302e31ef20bdaf3dd83b602","observation_id":"65adbaaf-dcbb-476e-92dd-4b698fcda1fa","resolution":{"observed_at":"2026-08-05T22:20:48.141486Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10764","last_updated":"2021-12-20T18:59:59Z","snapshot_observed_at":"2026-08-06T00:03:37.713050Z","submitted_at":"2021-12-20T18:59:59Z","title":"Mask2Former for Video Instance Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10764","snapshot_observed_at":"2026-08-05T22:20:46.977826Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.977826Z"},"links":{"cited_paper":"/paper/2112.10764","citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:00bb2de4c5ff200fe97de308c51e7fe27c918247d9b66f5a2f6eddb457bbfd4a","observation_id":"c631030b-3c73-4f78-a06e-796a12b477db","resolution":{"observed_at":"2026-08-05T22:20:46.977826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.127683Z","title":null,"venue":null,"work_id":"dcb8c711-7ee5-453c-89e6-275a22d4fc7d","year":2022},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.980836Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:2d70f0ed321a37668c3f3ff631d1ae29a1c80eb6c18569f128de04b3083452b9","observation_id":"72ab3102-02ff-4120-8652-5d6b8f92abda","resolution":{"observed_at":"2026-08-05T22:20:48.131868Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.118414Z","title":null,"venue":null,"work_id":"efee7130-9e8e-47c2-a3d8-c96deb9039b5","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.983334Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:a8b208e3a0139c749861d9fb045e4867b7fb40594fcfd2fff6c7c24bed265f16","observation_id":"aba6d726-24a6-4f4d-8933-b315c24410a2","resolution":{"observed_at":"2026-08-05T22:20:48.121763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:46.986308Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.986308Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:b0d52212cb4b147c584ad22049f1984e3f8d07f695199250914df75872692fff","observation_id":"64307ea4-088b-4558-ac02-8815c1e9a6cc","resolution":{"observed_at":"2026-08-05T22:20:46.986308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.103958Z","title":null,"venue":null,"work_id":"c918ac1a-8452-4f94-8067-d27194ca922d","year":2024},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.988817Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:4d1d71ee359b88b04fd6fd011699fe6ad97c7582dd3d79844e0e646cf04e0401","observation_id":"c5ff3d31-32f2-40eb-b890-24aaf73a12b3","resolution":{"observed_at":"2026-08-05T22:20:48.107075Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.35356","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.834663Z","title":null,"venue":null,"work_id":"bbde30fd-d6ce-4797-8063-dc0e85d7073b","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.991271Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:f155241b4fce0d24ae97d94d30ab0106f272cc02f30ff22523af580ff0ab0a3c","observation_id":"56aa824d-f455-46d3-8b9a-73bdfd350639","resolution":{"observed_at":"2026-08-05T22:20:47.840162Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.094598Z","title":null,"venue":null,"work_id":"3e45343b-f98a-4ee1-813c-69782c3f7798","year":2024},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.993827Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:fd0ea91c0c42e40760676d5d10e178271c013ca9cd4ea085060c14808dbaeb2d","observation_id":"2ae97255-c011-4419-93fd-a57e036ad93b","resolution":{"observed_at":"2026-08-05T22:20:48.098281Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.35429","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.762862Z","title":null,"venue":null,"work_id":"770909df-bea5-45a5-a0fb-c44954fdea0e","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.996674Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:6f8f3726b2c23da3685a6478547349e0b9f0b21732b677e37ffdcf44ecc97c8c","observation_id":"1421b5ca-f85e-4dd3-97f3-df5bbc9196af","resolution":{"observed_at":"2026-08-05T22:20:47.767858Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-05T22:20:46.999276Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:46.999276Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:1083472e70c8e5ef88c39ce7ea29ce01ca4fb0ea42147aab50f39625cc7f2dd7","observation_id":"95849dce-e49f-4957-8f94-fb6003c8830e","resolution":{"observed_at":"2026-08-05T22:20:46.999276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-05T22:20:47.001998Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.001998Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:d026f7f82e4deaf8ef3fee902d58919fee96db2730ab34810cbd4bf577e9685e","observation_id":"9d29f10c-828d-4c53-b511-f2fda78f1f8a","resolution":{"observed_at":"2026-08-05T22:20:47.001998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.084132Z","title":null,"venue":null,"work_id":"a378ae1b-e427-4ce0-9d95-6b1a39dfe97f","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.004489Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:e167b6ca6a11b10f397d6283972aedff42cdae133fa88a3e404dd2b1cbe5f127","observation_id":"3f4fcf82-af46-4b35-b2cc-c5f6645219df","resolution":{"observed_at":"2026-08-05T22:20:48.087600Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.073874Z","title":null,"venue":null,"work_id":"4e9bc162-fdfb-4554-b8b5-0605fb819b18","year":null},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.007131Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:f13d2f1d653c01736c55a7e56c7ee1c26f5dfc3284b1418505985a2783637ff6","observation_id":"eeaf4d72-20d0-4110-be68-4fa00f860dd3","resolution":{"observed_at":"2026-08-05T22:20:48.077156Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.012092Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.012092Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:c84575af71b46e5a495a12a8a21c7ec3d4d7ab319a5996faa3eda3eae3583570","observation_id":"46a66836-e689-4cb9-b4a4-a491a1c71ede","resolution":{"observed_at":"2026-08-05T22:20:47.012092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.046943Z","title":null,"venue":null,"work_id":"1195541e-5455-4e95-83eb-5eecf88e4402","year":null},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.014759Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:59a51909b6df9ec104d6f0274113580fab5a81a99dd422f6dfc0216e726e6a23","observation_id":"627bcc17-a4ff-4f01-8282-5fa0e0f80377","resolution":{"observed_at":"2026-08-05T22:20:48.050169Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.020126Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.020126Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:1dad8cee8ddbea13000666926ea5e3ff485ed6f69553c4fea666aa578c3cdb12","observation_id":"ae4d3b10-6fcf-4af4-92a4-7dcb2213e0dc","resolution":{"observed_at":"2026-08-05T22:20:47.020126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09501","last_updated":"2023-09-18T05:58:06Z","snapshot_observed_at":"2026-07-06T16:19:45.746334Z","submitted_at":"2023-09-18T05:58:06Z","title":"Discovering Sounding Objects by Audio Queries for Audio Visual Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09501","snapshot_observed_at":"2026-08-05T22:20:47.022621Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.022621Z"},"links":{"cited_paper":"/paper/2309.09501","citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:fe290592b3c6766793959fcd36173b0788f65e2fda28f84779f071bd726fef25","observation_id":"129e167f-c79f-44bc-a950-696bf00a21e0","resolution":{"observed_at":"2026-08-05T22:20:47.022621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.021842Z","title":null,"venue":null,"work_id":"4ab709d8-cef7-4eb8-8553-aeaf453bb8e3","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.025995Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:13d00714baf0d82a223d02e4e3c01e28bee7ec7ee273e5f19b7f51405730b0fc","observation_id":"bcce444a-146d-45d4-aeda-a341981a6eaf","resolution":{"observed_at":"2026-08-05T22:20:48.025814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.012015Z","title":null,"venue":null,"work_id":"1a4b5284-50d9-4b55-ac05-33dc752c6d1e","year":2021},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.028406Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:0ea2452ca82e105c2306ad19f1cf84d467bcbdaced878aec6aab2f2e2fb861f5","observation_id":"77a69dd2-473e-4cef-9885-91c6f4853220","resolution":{"observed_at":"2026-08-05T22:20:48.015286Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.031260Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.031260Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:2fea6cf362f71fcb7829be73a96c5e959ca710dba66fa7b5676af417064012d9","observation_id":"8137e550-c77a-4e63-a144-72cc7ee71d72","resolution":{"observed_at":"2026-08-05T22:20:47.031260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.984908Z","title":null,"venue":null,"work_id":"37f6466b-3cd0-489e-bc3a-fb5380765c41","year":1955},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.036465Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:60854a0e74117f57f69c53de114d3b0c75996404b8e58866f67daf12c1182db1","observation_id":"f9f93386-eef9-465a-b6dd-86544e0d5bb2","resolution":{"observed_at":"2026-08-05T22:20:47.988247Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.038914Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.038914Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:bf0119b6d65fbd638b1c506b99354a63c87d6c7ac82b553d1a3f7cab3b66271f","observation_id":"5445e4a4-578c-43b5-adb9-53b05a5938e2","resolution":{"observed_at":"2026-08-05T22:20:47.038914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.16924","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.615909Z","title":null,"venue":null,"work_id":"5112ba74-6136-4e4a-9fd0-6bacb6230f5f","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.041622Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:542805cf893a921c31ac2ed6557a7a903cbb0c9c1d7140c4c7e62ba75bbd4de9","observation_id":"a95728fe-d1f0-4347-a03c-ec396870c3e2","resolution":{"observed_at":"2026-08-05T22:20:47.620299Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.043930Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.043930Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:04b96202af9583d907f8d84b46425dec697b592b7ad85c54a90389e4c1ff1f55","observation_id":"c001451a-f592-427b-8c6c-7f29be14e319","resolution":{"observed_at":"2026-08-05T22:20:47.043930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.969267Z","title":null,"venue":null,"work_id":"1d6aae10-2cd6-4b38-8c18-1af08908c556","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.046439Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:d4d7ac7a032273921695654302a2d182bbd6b595134fb5f0cbd287bf2013c7ff","observation_id":"9b5fce69-5f7c-4e02-8d39-cd65a86abbd4","resolution":{"observed_at":"2026-08-05T22:20:47.972806Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.049034Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.049034Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:b7d5029da8746fd9ffb0d274313bdc8ec0bcbee79090b827c1f0ca8acd80fe93","observation_id":"2be4d592-5d47-468c-99d0-4a264f74b04a","resolution":{"observed_at":"2026-08-05T22:20:47.049034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.051413Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.051413Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:1dc8894e20f6bc5b994bcf3559f2ede6e2cb117788ff2e36f28b8e162ad714c3","observation_id":"6cfe210b-3ade-4f36-aca3-9199a7d0085d","resolution":{"observed_at":"2026-08-05T22:20:47.051413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.950143Z","title":null,"venue":null,"work_id":"a06bfe0d-c215-4f5b-9b4b-0c207d3046df","year":2017},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.053799Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:15f31420d3ffa447e39b43321ad10788836fac676ab6154eb7fd0b1b54028ef1","observation_id":"d88881ba-8178-4f84-b69e-0711355f876d","resolution":{"observed_at":"2026-08-05T22:20:47.953219Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.939958Z","title":null,"venue":null,"work_id":"bbb3399c-55be-4a7b-bf4b-eb4059a1547a","year":2021},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.056388Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:25de07fbb7d290e4067455451f9dbe3a55dac42dadedfe1d6c9c262c4ff8dd48","observation_id":"88e860b3-446a-4699-845b-a871afeea73b","resolution":{"observed_at":"2026-08-05T22:20:47.944151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.07619","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.540628Z","title":null,"venue":null,"work_id":"4b6f6270-86b3-4e63-81f3-b74ba03ae3ff","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.059153Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:809e0220f6512757bc7532eb80467372acebe05e9c38aee3b70d93193c8ff8ab","observation_id":"f3b7eda0-ccbc-4311-bf89-a74370bed6b9","resolution":{"observed_at":"2026-08-05T22:20:47.544770Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.14203","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.482046Z","title":null,"venue":null,"work_id":"5a238371-ca21-4974-9188-8d0530b1ad2a","year":2026},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.061621Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:0d7e87d3e6508d0be5b3fed85b50834e09beaf765dce616c492fdcb790632f7b","observation_id":"4b244050-50a9-49e7-a6f6-d71410e9d03c","resolution":{"observed_at":"2026-08-05T22:20:47.486666Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.064224Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.064224Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:145b89870f8a94a0f2fe3fcf3b5e69c67fff3ee74a89a688e89a39ffec61a3fb","observation_id":"54b849a4-c123-4e9f-aa97-66eab3b96a06","resolution":{"observed_at":"2026-08-05T22:20:47.064224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18912","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.362413Z","title":null,"venue":null,"work_id":"4989c3e3-54e4-430e-9c34-3b21d0d2c1dc","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.066685Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:fac113ab0d87d8dcc500b28f411764b591485068ac9da94dcdeb56c9ed009f97","observation_id":"960c9227-348f-408d-a484-7c258e52b061","resolution":{"observed_at":"2026-08-05T22:20:47.367000Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.12701","last_updated":"2020-10-24T02:03:02Z","snapshot_observed_at":"2026-08-08T10:04:43.666131Z","submitted_at":"2020-06-23T02:22:14Z","title":"Unsupervised Sound Separation Using Mixture Invariant Training","version":2},"cited_work":{"arxiv_id":"2006.12701","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.12701","snapshot_observed_at":"2026-08-05T22:20:47.281590Z","title":"Unsupervised Sound Separation Using Mixture Invariant Training","venue":"eess.AS","work_id":"4cdbd37d-2c2d-470d-8088-c753320c6f1e","year":2020},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.069256Z"},"links":{"cited_paper":"/paper/2006.12701","citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:0786215bb0fdc2ef227100d0b66bd3bf2b25c8782fc24332e343ed894489fb45","observation_id":"6f0edab2-d0cc-4186-9d23-b62afa23dcae","resolution":{"observed_at":"2026-08-05T22:20:47.285019Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.930989Z","title":null,"venue":null,"work_id":"71609494-cc05-422b-8883-ab820c44c21c","year":2022},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.072217Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:cede5cc80f3fa873f5740d95de26cd0ef5bf357cfc0d4eb24c21560f5a7226ee","observation_id":"c823310a-bda9-4560-a660-157e8daaa2bb","resolution":{"observed_at":"2026-08-05T22:20:47.934410Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6027.37548","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.268512Z","title":null,"venue":null,"work_id":"4e3d9a41-a357-4a46-87af-a42f75c3f01e","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.074935Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:41411b1dbac1182e99a659e92985cae2206800961a4a5c6553cbe8dbea51ddec","observation_id":"7bf0e5db-cc6b-46e8-994f-3be07df21322","resolution":{"observed_at":"2026-08-05T22:20:47.273669Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.922625Z","title":null,"venue":null,"work_id":"9951f673-39f6-4b48-ae49-b160391cdb40","year":2019},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.077235Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:b467e3e0c992c5748f9f1c1a35315e1332b5b200d0c4eb1df4c35acd47593683","observation_id":"464ba9fb-9ffb-4717-9dbb-705c39c31db7","resolution":{"observed_at":"2026-08-05T22:20:47.925641Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.913337Z","title":null,"venue":null,"work_id":"234d8029-0872-4ca9-a22a-3f978d63bbbe","year":2024},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.079559Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:16379d37e84a100c4259c3c5380b0535bd0e83bbe64227fe820f0009a966d4a0","observation_id":"34cb60da-b0e2-444c-b683-56be10956115","resolution":{"observed_at":"2026-08-05T22:20:47.916295Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.903907Z","title":null,"venue":null,"work_id":"ef2c1106-3597-4efd-a4d7-0c23088e7a59","year":2022},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.082468Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:bb85ad8c17bdd47b49a0d37b1d69bf10dae073575197f41f5aa07b214e4b7636","observation_id":"f2ee2bf6-c167-4c40-9d37-378cb28076db","resolution":{"observed_at":"2026-08-05T22:20:47.907254Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.894401Z","title":null,"venue":null,"work_id":"d0869a8d-645b-4a10-8e9f-6c8cc1da1d73","year":2023},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.084946Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:cd1346c5982d2d54b3775f6410d082641cbdd282cd8149b3210e756cad8875ce","observation_id":"cdebe805-f345-4642-b4d6-acee3fdbaefb","resolution":{"observed_at":"2026-08-05T22:20:47.897891Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.16260","last_updated":"2026-06-28T11:36:31Z","snapshot_observed_at":"2026-08-05T16:11:36.619314Z","submitted_at":"2026-06-28T11:36:31Z","title":"AdaSurvMamba: Dynamic Fusion and Semantic Scanning for Multimodal Survival Analysis","version":1},"cited_work":{"arxiv_id":"2607.16260","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.16260","snapshot_observed_at":"2026-08-05T22:20:47.196216Z","title":"AdaSurvMamba: Dynamic Fusion and Semantic Scanning for Multimodal Survival Analysis","venue":"cs.LG","work_id":"01390b6f-4cd6-4431-bcda-ec1bc3385f1d","year":2026},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.087437Z"},"links":{"cited_paper":"/paper/2607.16260","citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:96d6aba71da137b0f7c2c32daaebc499c1de4361c6ab9b3ce259c5965b9e8a0f","observation_id":"6a557f30-d4e2-4a2a-ad91-3b8ccc4074fd","resolution":{"observed_at":"2026-08-05T22:20:47.200912Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.885703Z","title":null,"venue":null,"work_id":"5c195099-5d71-42b0-8770-31630a253cd4","year":2025},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.090040Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:cb74f3344700de8610cd11c42fc205ca02c4fce833358efdf240b795a8939e85","observation_id":"4aedaf0e-e70f-4906-8549-a657c8daac56","resolution":{"observed_at":"2026-08-05T22:20:47.888680Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.092359Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.092359Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:96a884531379969f448c8d7383c0146ca2503fcd3dbd43f98e7c90b3a497840e","observation_id":"9151cad6-6dad-4b5f-8a88-5c291f09c3f4","resolution":{"observed_at":"2026-08-05T22:20:47.092359Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.876564Z","title":null,"venue":null,"work_id":"a848722d-a9bc-4c4b-ab74-676161c2ec16","year":2022},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.094692Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:f9e3939e0b087522fff444d783c56703ebd0889e1847699485e1a08a4a3e26e5","observation_id":"b3c944e5-aa49-4d10-9af3-c857259df8db","resolution":{"observed_at":"2026-08-05T22:20:47.879736Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.867549Z","title":null,"venue":null,"work_id":"5ce9875d-4e51-4b7d-abef-1b1c60bfa992","year":2024},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.097341Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:9fa6035b951d2e3217417211cf76658078c7000bfbd5fb9c2d20171b12c4a39c","observation_id":"390e3838-6219-45a6-9edd-408aad9f7ac6","resolution":{"observed_at":"2026-08-05T22:20:47.870895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.036692Z","title":null,"venue":null,"work_id":"8e6de3f3-a702-4c13-aa30-a156860d4e4c","year":2022},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.017755Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:f210b32e17f3c1751c69a256244cda8f0f10ed7d4b266080571123b148bec05a","observation_id":"047bc0c5-74a4-4faf-83e9-4c453c2aa51a","resolution":{"observed_at":"2026-08-05T22:20:48.040240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:47.995662Z","title":"InIEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"a17e7898-f1e3-4994-9486-b3fa87b42f34","year":null},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.033744Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:96d605645fc8678f9865439d73a6ac7603945c7b4a373cb8005f72a25d7eea83","observation_id":"7b2bcfa8-d413-4937-921f-21fa89b9380a","resolution":{"observed_at":"2026-08-05T22:20:47.999195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:20:48.063341Z","title":"In Proceedings of the AAAI conference on artificial intelligence, Vol","venue":null,"work_id":"7ccda9bc-587c-46a3-8f85-b220e507786a","year":2067},"citing_paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T22:20:47.009539Z"},"links":{"citing_paper":"/paper/2608.03264"},"observation_digest":"sha256:24ea2606bdb63857af5b3736f1402c078eedb582784577f30c4346133e0f9182","observation_id":"afed60a0-0e63-40b4-b603-3ec3d154e629","resolution":{"observed_at":"2026-08-05T22:20:48.067051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.03264","last_updated":"2026-08-04T07:35:57Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-07T23:10:49.313378Z","submitted_at":"2026-08-04T07:35:57Z","title":"Hear to See: Discerning Stateful Listening for Audio-Visual Instance Segmentation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":1,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":37,"verified_exact":6,"verified_fuzzy":2},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2608.03264."}