{"as_of":"2026-08-08T08:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c272a1453fe94880af91289cc415b1fa0dc9e32223bbfd4e8ddf0aeb7a5a8860","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:27:05.708277Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T22:09:56.270516Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T05:45:56.102421Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"cited_work":{"arxiv_id":"2506.05328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05328","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Av-reasoner: Improving and bench- marking clue-grounded audio-visual counting for mllms.arXiv preprint arXiv:2506.05328","venue":null,"work_id":"58652bd4-42de-47ed-ba87-b00df506fea0","year":2025},"citing_paper":{"arxiv_id":"2510.15148","last_updated":"2026-04-04T21:55:10Z","snapshot_observed_at":"2026-07-06T22:32:51.756468Z","submitted_at":"2025-10-16T21:10:22Z","title":"XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T05:45:07.700571Z"},"links":{"cited_paper":"/paper/2506.05328","citing_paper":"/paper/2510.15148"},"observation_digest":"sha256:8513c927451813caa99880e99ac1013aaa14a0ae18be439d68a17f175022c62d","observation_id":"9c2be27d-d82f-4e75-b00e-629425ae9f37","resolution":{"observed_at":"2026-05-18T05:45:56.105299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05328","snapshot_observed_at":"2026-07-14T22:09:56.270516Z","title":"arXiv preprint arXiv:2506.05328 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.12703","last_updated":"2026-06-29T17:45:27Z","snapshot_observed_at":"2026-08-06T02:01:46.246977Z","submitted_at":"2026-03-13T06:28:46Z","title":"SVCBench: A Streaming Video Counting Benchmark for Spatial-Temporal State Maintenance","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T22:09:56.270516Z"},"links":{"cited_paper":"/paper/2506.05328","citing_paper":"/paper/2603.12703"},"observation_digest":"sha256:4d4fec187a77c96e1092debfcda52dc0403b610bf824b5f59e6239b9e6803e38","observation_id":"e3189c56-f1bb-4f92-8354-b7a926ffdf6e","resolution":{"observed_at":"2026-07-14T22:09:56.270516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"cited_work":{"arxiv_id":"2506.05328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05328","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Av-reasoner: Improving and bench- marking clue-grounded audio-visual counting for mllms.arXiv preprint arXiv:2506.05328","venue":null,"work_id":"58652bd4-42de-47ed-ba87-b00df506fea0","year":2025},"citing_paper":{"arxiv_id":"2604.14520","last_updated":"2026-04-16T01:21:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T01:21:14Z","title":"Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T12:05:54.551728Z"},"links":{"cited_paper":"/paper/2506.05328","citing_paper":"/paper/2604.14520"},"observation_digest":"sha256:c73b8dbd5c7db226ed1ccf91af60806078888cd8c66ebac8bc95d29f9e9ade73","observation_id":"e4baaf95-ed9e-476e-b0ff-3904fcbc7312","resolution":{"observed_at":"2026-05-10T12:10:22.142010Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"cited_work":{"arxiv_id":"2506.05328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05328","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Av-reasoner: Improving and bench- marking clue-grounded audio-visual counting for mllms.arXiv preprint arXiv:2506.05328","venue":null,"work_id":"58652bd4-42de-47ed-ba87-b00df506fea0","year":2025},"citing_paper":{"arxiv_id":"2604.16617","last_updated":"2026-04-17T18:13:27Z","snapshot_observed_at":"2026-08-02T22:28:35.019925Z","submitted_at":"2026-04-17T18:13:27Z","title":"AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T08:02:53.574120Z"},"links":{"cited_paper":"/paper/2506.05328","citing_paper":"/paper/2604.16617"},"observation_digest":"sha256:a8c4bfeb4d226702d1f28eb01a5c601db8172f41c54149c82e2fd26b46064434","observation_id":"da73e082-7283-4c33-aaae-e153c39db0af","resolution":{"observed_at":"2026-05-10T09:18:32.125415Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"cited_work":{"arxiv_id":"2506.05328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05328","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Av-reasoner: Improving and bench- marking clue-grounded audio-visual counting for mllms.arXiv preprint arXiv:2506.05328","venue":null,"work_id":"58652bd4-42de-47ed-ba87-b00df506fea0","year":2025},"citing_paper":{"arxiv_id":"2605.12034","last_updated":"2026-05-13T20:38:46Z","snapshot_observed_at":"2026-07-31T22:09:03.342383Z","submitted_at":"2026-05-12T12:16:11Z","title":"Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T03:49:58.240883Z"},"links":{"cited_paper":"/paper/2506.05328","citing_paper":"/paper/2605.12034"},"observation_digest":"sha256:b3640c738211c2706e0cfed3f9b334584b4368aee4ae3d6c85fe7896175ba68d","observation_id":"11430591-9fb8-4725-9863-066575a13626","resolution":{"observed_at":"2026-05-13T03:52:12.698673Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"cited_work":{"arxiv_id":"2506.05328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05328","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Av-reasoner: Improving and bench- marking clue-grounded audio-visual counting for mllms.arXiv preprint arXiv:2506.05328","venue":null,"work_id":"58652bd4-42de-47ed-ba87-b00df506fea0","year":2025},"citing_paper":{"arxiv_id":"2605.12034","last_updated":"2026-05-13T20:38:46Z","snapshot_observed_at":"2026-07-31T22:09:03.342383Z","submitted_at":"2026-05-12T12:16:11Z","title":"Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T06:06:20.658030Z"},"links":{"cited_paper":"/paper/2506.05328","citing_paper":"/paper/2605.12034"},"observation_digest":"sha256:f11fefab88da7895ab3015ed29b21459108de8e9d3491c31a23115c6250924ff","observation_id":"2449202f-3603-4a76-9f9c-6f41ce858e3d","resolution":{"observed_at":"2026-05-15T06:09:50.259437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05328","snapshot_observed_at":"2026-07-14T12:48:58.688011Z","title":"arXiv preprint arXiv:2506.05328 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10299","last_updated":"2026-07-11T13:04:24Z","snapshot_observed_at":"2026-08-06T08:13:12.036559Z","submitted_at":"2026-07-11T13:04:24Z","title":"Empowering Long-form Omni-modal Understanding with Robust Audio Perception","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T12:48:58.688011Z"},"links":{"cited_paper":"/paper/2506.05328","citing_paper":"/paper/2607.10299"},"observation_digest":"sha256:d2a8ddfa97a76bf2d5064d2ab2c8f6b3652f0ea94fdfda9bc2ae3cfbcfb08287","observation_id":"15ec56f8-173e-4780-b416-249258d469bf","resolution":{"observed_at":"2026-07-14T12:48:58.688011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05328/citation-record","integrity":"/paper/2506.05328/integrity","json":"/paper/2506.05328/citation-record.json","paper":"/paper/2506.05328"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T10:27:05.464312Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.464312Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:df24e71ce52884f416b66ab154927f26bbf8b1be123fef252664bccb0ce9e01a","observation_id":"a684ffce-ddae-4dfa-b02a-13da027d9496","resolution":{"observed_at":"2026-08-07T10:27:05.464312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T10:27:05.468595Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.468595Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:99f8ea5c385c8963a649e4309f92d3ca52a86147713ff764b5799910fb44edca","observation_id":"6be6bd9a-0430-44a7-9f86-3859b73daa87","resolution":{"observed_at":"2026-08-07T10:27:05.468595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.471940Z","title":"Eagle 2.5: Boosting long-context post-training for frontier vision-language models.arXiv preprint arXiv:2504.15271, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.471940Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:5814b2092bfe5b40ded007eb02c3c06a6aa784fc326d1a862d04179dbc9d2c49","observation_id":"22c657ba-6fc6-4910-9e5a-f65fe28c6634","resolution":{"observed_at":"2026-08-07T10:27:05.471940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-07T10:27:05.475164Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding.arXiv preprint arXiv:2501.13106, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.475164Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:26722c56c153b0148bb869071530260544df6b17e23d1d6cad8fc38e24a890ec","observation_id":"e2307a22-5132-418a-bd8d-d6bf2f3373d7","resolution":{"observed_at":"2026-08-07T10:27:05.475164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.562506Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":"382e3845-bbbd-4b26-be08-0b0b94c76db8","year":2023},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.478496Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:1f08112ded45bbd59bc3c05c284e8bc9bf870922792a3fa08fca2008a868c87d","observation_id":"77bb1d4b-203d-486f-8adf-71fbb007e644","resolution":{"observed_at":"2026-08-07T10:27:06.565887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T10:27:05.482122Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms.arXiv preprint arXiv:2406.07476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.482122Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:84f43c365edf5adfdef0d707d77f57ef03a3918afabeaf957df2fd375df4c89a","observation_id":"aec4a5df-6f37-466a-955a-a43cfada4361","resolution":{"observed_at":"2026-08-07T10:27:05.482122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T10:27:05.486127Z","title":"Video-llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.486127Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:475b9db01b4171b8fe012e24ef44e20e66a9a3bcd84825e9d8c458ffbaff5fbf","observation_id":"e816cc37-4f83-46ff-b32a-26b4eaafe715","resolution":{"observed_at":"2026-08-07T10:27:05.486127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-07T10:27:05.489310Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.arXiv preprint arXiv:2312.14238, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.489310Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:cfcb57e9af09852bb7257b625715f3ecd4805ab4c068b36212698fa9eaac0f0e","observation_id":"dbda99d1-540f-4f58-b15b-70c985135e06","resolution":{"observed_at":"2026-08-07T10:27:05.489310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T10:27:05.492480Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.arXiv preprint arXiv:2404.16821, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.492480Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:9db19703825af9fd188802cb50b6cf11f5572f91d63343eb43aaef8437c6cf3f","observation_id":"fbd5d1e7-aff8-4073-980f-3d9d450d7a83","resolution":{"observed_at":"2026-08-07T10:27:05.492480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T10:27:05.495697Z","title":"Internvideo: General video foundation models via generative and discriminative learning.CoRR, abs/2212.03191, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.495697Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:05014b1be337d960e70b3c35fb63e316e6d2c6ce9fa46cb3e8a86971689d8053","observation_id":"0ba4e3ee-4df0-48c8-b7f6-ca213a40175a","resolution":{"observed_at":"2026-08-07T10:27:05.495697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-01T19:17:08.239976Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-08-07T10:27:05.499105Z","title":"Internvideo2: Scaling video foundation models for multimodal video understanding.arXiv preprint arXiv:2403.15377, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.499105Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:858e9d3cc92b761111fbbf50ced8ff89c2404e91e073fe303a1e41486a7353b7","observation_id":"5c096c6d-ac30-465c-a225-b79619168202","resolution":{"observed_at":"2026-08-07T10:27:05.499105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.502419Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.502419Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:b4b8a571e32dc749e6f9a76658330c8632abbfc8ec99bf9681f8b6046fb4e2b3","observation_id":"09444582-a7b0-46d5-9633-3341ba5b0202","resolution":{"observed_at":"2026-08-07T10:27:05.502419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-05T11:54:14.447608Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T10:27:05.505880Z","title":"Cogvlm2: Visual language models for image and video understanding.arXiv preprint arXiv:2408.16500, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.505880Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:3735f3b8444da4e6c21339d7b4ef7c55c4ebdcec8cbd2241386ed81259c2df80","observation_id":"46c9b6b1-1bdf-47dc-9e13-ea4ac9dc1f34","resolution":{"observed_at":"2026-08-07T10:27:05.505880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-07-06T15:30:49.735343Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-07T10:27:05.509262Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.509262Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:26a8b1e2072640e75e4bd62f9761b85245e8d7faf89dcf867065488a68bf1da1","observation_id":"5e2d9d77-a5ee-42a6-8377-2f5e94b38832","resolution":{"observed_at":"2026-08-07T10:27:05.509262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17085","last_updated":"2024-07-24T08:22:49Z","snapshot_observed_at":"2026-07-06T18:51:11.049568Z","submitted_at":"2024-07-24T08:22:49Z","title":"OVR: A Dataset for Open Vocabulary Temporal Repetition Counting in Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17085","snapshot_observed_at":"2026-08-07T10:27:05.512719Z","title":"Ovr: A dataset for open vocabulary temporal repetition counting in videos.arXiv preprint arXiv:2407.17085, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.512719Z"},"links":{"cited_paper":"/paper/2407.17085","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:427d176442bb304b3509754dd7c62c572c51359c361e25f92d18ab227b852d31","observation_id":"5e625726-1323-43d1-b2b6-16c47c50e13f","resolution":{"observed_at":"2026-08-07T10:27:05.512719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.545477Z","title":"Dvd-counting, 2025","venue":null,"work_id":"a35d6f84-069c-4144-936d-8e9146b3f485","year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.516090Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:0f57a223a41fa22cbba3af3de7d2ae9225d23564f922e6298d2bb7ce861639be","observation_id":"300bb223-9ce7-44fe-9ffb-674a621388d9","resolution":{"observed_at":"2026-08-07T10:27:06.548934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.519281Z","title":"Counting out time: Class agnostic video repetition counting in the wild","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.519281Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:6ab8c79fd329b6cf3b588f1610d6a257dd3b1afda584e72457860da42a1702bd","observation_id":"3a54d292-f766-44d4-a434-7cda7ddb0235","resolution":{"observed_at":"2026-08-07T10:27:05.519281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.529684Z","title":"Repetitive activity counting by sight and sound","venue":null,"work_id":"11646b16-49ff-4c87-bdf2-469efc291304","year":2021},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.522916Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:097daaa51152bfff7b118d1ba38bba1b5537d257ac9dbc7990c374398fa193a3","observation_id":"3fdb8348-6f9e-4a57-b55f-82e31989d5c2","resolution":{"observed_at":"2026-08-07T10:27:06.532936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01018","last_updated":"2022-04-03T07:50:18Z","snapshot_observed_at":"2026-07-06T12:56:07.820484Z","submitted_at":"2022-04-03T07:50:18Z","title":"TransRAC: Encoding Multi-scale Temporal Correlation with Transformers for Repetitive Action Counting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01018","snapshot_observed_at":"2026-08-07T10:27:05.526108Z","title":"Transrac: Encoding multi-scale temporal correlation with transformers for repetitive action counting.arXiv preprint arXiv:2204.01018, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.526108Z"},"links":{"cited_paper":"/paper/2204.01018","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:333f9d5cd1cb306432e965814bd46e458d383f755ad1a8db6eae7ef7816056b2","observation_id":"771c62c1-f2e7-4a53-aedc-b111cfc00a7f","resolution":{"observed_at":"2026-08-07T10:27:05.526108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12075","last_updated":"2024-12-16T18:46:45Z","snapshot_observed_at":"2026-07-06T20:07:58.873037Z","submitted_at":"2024-12-16T18:46:45Z","title":"CG-Bench: Clue-grounded Question Answering Benchmark for Long Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.12075","snapshot_observed_at":"2026-08-07T10:27:05.529740Z","title":"Cg-bench: Clue-grounded question answering benchmark for long video understanding.arXiv preprint arXiv:2412.12075, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.529740Z"},"links":{"cited_paper":"/paper/2412.12075","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:08eae6b1a2a73e7b3d8ab02eee585a7dd4710f89934f133ca17dcfc8b83ee1bd","observation_id":"02223deb-a7f6-4379-8ff1-a37f4262b12d","resolution":{"observed_at":"2026-08-07T10:27:05.529740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-08-07T10:27:05.533023Z","title":"Ola: Pushing the frontiers of omni-modal language model with progressive modality alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.533023Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:0b8b643d45dbd95565e9c588b8e99ca153c37d040c0d018a676fce2542f450b8","observation_id":"be396407-bbd2-4d64-bb62-6ae72aab8163","resolution":{"observed_at":"2026-08-07T10:27:05.533023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:27:05.536387Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.536387Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:760531d08a6e47355fbf22a7334f5b822535abe4f040a1c86f4699441ba3e74c","observation_id":"806f6ff7-5b7b-4842-9630-86556c9f42b7","resolution":{"observed_at":"2026-08-07T10:27:05.536387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.539317Z","title":"Curriculum learning for reinforcement learning domains: A framework and survey.Journal of Machine Learning Research, 21(181):1–50, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.539317Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:b50c1eef311d3f083bd8ca1c99dbb35403daa81497d720a5c7b4eedbe61192ce","observation_id":"d411759c-8069-4827-b3b0-eabe637af90a","resolution":{"observed_at":"2026-08-07T10:27:05.539317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12226","last_updated":"2025-09-08T07:04:17Z","snapshot_observed_at":"2026-07-06T17:32:15.447061Z","submitted_at":"2024-02-19T15:33:10Z","title":"AnyGPT: Unified Multimodal LLM with Discrete Sequence Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12226","snapshot_observed_at":"2026-08-07T10:27:05.542467Z","title":"Anygpt: Unified multimodal llm with discrete sequence modeling.arXiv preprint arXiv:2402.12226, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.542467Z"},"links":{"cited_paper":"/paper/2402.12226","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:ea538057af2c1bace56a78185a5b031357b869dee2c5dd86c542d09a07bacd1f","observation_id":"c7b9bcc2-ec63-4c1a-b970-4323e5492402","resolution":{"observed_at":"2026-08-07T10:27:05.542467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.545846Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.545846Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:14750b887d1726268d23d27a39e31e758bb4520d4bc05ffc93f5e7f26388c139","observation_id":"9e0e43b2-8ea1-4d4b-9536-cd3afc7f67f2","resolution":{"observed_at":"2026-08-07T10:27:05.545846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11190","last_updated":"2024-11-05T02:27:57Z","snapshot_observed_at":"2026-07-06T19:33:34.819837Z","submitted_at":"2024-10-15T02:10:45Z","title":"Mini-Omni2: Towards Open-source GPT-4o with Vision, Speech and Duplex Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11190","snapshot_observed_at":"2026-08-07T10:27:05.549332Z","title":"Mini-omni2: Towards open-source gpt-4o with vision, speech and duplex capabilities.arXiv preprint arXiv:2410.11190, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.549332Z"},"links":{"cited_paper":"/paper/2410.11190","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:7843d3ac9361933094d4b94425fe9e1968ff1bfcbaa7f0c4af5e45c769f18b0b","observation_id":"686c5244-6f31-443a-a4b1-34f22aab81aa","resolution":{"observed_at":"2026-08-07T10:27:05.549332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12109","last_updated":"2024-10-15T23:16:28Z","snapshot_observed_at":"2026-08-07T09:46:53.578617Z","submitted_at":"2024-10-15T23:16:28Z","title":"OMCAT: Omni Context Aware Transformer","version":1},"cited_work":{"arxiv_id":"2410.12109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12109","snapshot_observed_at":"2026-08-07T10:27:06.043077Z","title":"OMCAT: Omni Context Aware Transformer","venue":"cs.CL","work_id":"20e71dea-59cc-448a-b234-70200137bd8a","year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.553172Z"},"links":{"cited_paper":"/paper/2410.12109","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:747a3e79e7af8d14697cb4ef85b166f3f98229c030bad86c378587a90a6a2c03","observation_id":"addbeab7-af44-472e-9131-91bcf2215c69","resolution":{"observed_at":"2026-08-07T10:27:06.046811Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.557034Z","title":"Baichuan-omni-1.5 technical report.arXiv preprint arXiv:2501.15368, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.557034Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:4c7b375358fd4e3d7e5b5fff0d35810479b221c96f0c1d99ec89d7a15597d18f","observation_id":"9ca97b63-d6e3-4293-87f8-684f8ed388ba","resolution":{"observed_at":"2026-08-07T10:27:05.557034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13068","last_updated":"2025-03-17T11:19:03Z","snapshot_observed_at":"2026-08-07T16:58:15.380194Z","submitted_at":"2025-03-17T11:19:03Z","title":"Crab: A Unified Audio-Visual Scene Understanding Model with Explicit Cooperation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13068","snapshot_observed_at":"2026-08-07T10:27:05.560273Z","title":"Crab: A unified audio-visual scene understanding model with explicit cooperation.arXiv preprint arXiv:2503.13068, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.560273Z"},"links":{"cited_paper":"/paper/2503.13068","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:436a835492f79c0981b42c7fbc792b5811d60c404c2a0eec0f62baae05b59445","observation_id":"18af2022-4246-4367-be8f-081bb7661fe2","resolution":{"observed_at":"2026-08-07T10:27:05.560273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15704","last_updated":"2024-06-22T01:36:11Z","snapshot_observed_at":"2026-07-06T18:35:17.953523Z","submitted_at":"2024-06-22T01:36:11Z","title":"video-SALMONN: Speech-Enhanced Audio-Visual Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15704","snapshot_observed_at":"2026-08-07T10:27:05.563770Z","title":"video-salmonn: Speech-enhanced audio-visual large language models.arXiv preprint arXiv:2406.15704, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.563770Z"},"links":{"cited_paper":"/paper/2406.15704","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:d2339cd9d415465299fdce6dc1e8ee2fc850b8af42b712518f3e4484de59748e","observation_id":"3a2e00d1-6dff-4ecc-9867-4cf0fc9abd08","resolution":{"observed_at":"2026-08-07T10:27:05.563770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.567346Z","title":"Meerkat: Audio-visual large language model for grounding in space and time","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.567346Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:f106bf74a6804971698e2a716c1bf86bb9477ac6914ed6006faf57cac2d1521a","observation_id":"5ecc1de9-e393-4d1f-bf8e-82aeb980cc0d","resolution":{"observed_at":"2026-08-07T10:27:05.567346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19794","last_updated":"2025-03-25T16:02:37Z","snapshot_observed_at":"2026-08-07T16:37:56.677886Z","submitted_at":"2025-03-25T16:02:37Z","title":"PAVE: Patching and Adapting Video Large Language Models","version":1},"cited_work":{"arxiv_id":"2503.19794","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.19794","snapshot_observed_at":"2026-08-07T10:27:05.974991Z","title":"PAVE: Patching and Adapting Video Large Language Models","venue":"cs.CV","work_id":"34f711c3-d337-4ed8-b10c-fbce3dd2b896","year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.570467Z"},"links":{"cited_paper":"/paper/2503.19794","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:1fe708c72738ccb4781f3ea2b8bed9d0b48169d8219c380ea9c9102e655f7231","observation_id":"e178f6d4-3cc7-4795-9423-6e16a9a8f312","resolution":{"observed_at":"2026-08-07T10:27:05.978456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09367","last_updated":"2025-03-07T09:40:34Z","snapshot_observed_at":"2026-08-03T15:46:09.775614Z","submitted_at":"2024-06-13T17:50:05Z","title":"Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09367","snapshot_observed_at":"2026-08-07T10:27:05.574186Z","title":"Needle in a video haystack: A scalable synthetic evaluator for video mllms.arXiv preprint arXiv:2406.09367, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.574186Z"},"links":{"cited_paper":"/paper/2406.09367","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:61cc8c0e313069af935aa0219e05b3d620a4aa4bad01eb9036b607970816f1a1","observation_id":"bf31b9ad-6fc1-401a-be87-937002b6cf52","resolution":{"observed_at":"2026-08-07T10:27:05.574186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.500574Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"a3e19006-649d-47b3-986c-1c13decec32d","year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.578385Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:b73c760cef5619846087e0adff18899ef2c8b57189c2eced966d99207b7bbe00","observation_id":"c6254dd5-267a-4a5b-a5c4-fc16f2043bbb","resolution":{"observed_at":"2026-08-07T10:27:06.503625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04326","snapshot_observed_at":"2026-08-07T10:27:05.581493Z","title":"Worldsense: Evaluat- ing real-world omnimodal understanding for multimodal llms.arXiv preprint arXiv:2502.04326, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.581493Z"},"links":{"cited_paper":"/paper/2502.04326","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:892c397369017b82c22aff6b0f497aaca18c2e13019a27cd5d82c730ef952ca2","observation_id":"84bd407e-a595-4e5a-a0a5-5fa754d236f5","resolution":{"observed_at":"2026-08-07T10:27:05.581493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.584562Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.584562Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:54244492a04056afdbd648b30a90e657be6ce4755aa31d634416500f559e6b27","observation_id":"0b61ec07-d356-4e35-894e-09aab9193737","resolution":{"observed_at":"2026-08-07T10:27:05.584562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-07T10:27:05.587891Z","title":"Visual-rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.587891Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:01ba20b24d590df11160ad150a368191460c40d62346ea61fa5cd41ef26dbeb7","observation_id":"34bc1aaf-6807-4143-893e-f983d1033b79","resolution":{"observed_at":"2026-08-07T10:27:05.587891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-07T10:27:05.591545Z","title":"Video-r1: Reinforcing video reasoning in mllms.arXiv preprint arXiv:2503.21776, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.591545Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:5f433b10734ae3b90a1fb5ebce45d9e24dcc61bea78da4e254e041c5c4b1aada","observation_id":"7d06622a-75a5-4ce8-a4ce-e48d40e83409","resolution":{"observed_at":"2026-08-07T10:27:05.591545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06958","last_updated":"2025-11-11T08:30:00Z","snapshot_observed_at":"2026-08-02T02:31:33.589341Z","submitted_at":"2025-04-09T15:09:27Z","title":"VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06958","snapshot_observed_at":"2026-08-07T10:27:05.594716Z","title":"Videochat-r1: Enhancing spatio-temporal perception via reinforce- ment fine-tuning.arXiv preprint arXiv:2504.06958, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.594716Z"},"links":{"cited_paper":"/paper/2504.06958","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:6832eecca50d3a15ac92fd3d5445892a89c04da13db98ce0c21b49b938ac691d","observation_id":"79e302ca-b92a-4cb5-9391-af5c5397bfa4","resolution":{"observed_at":"2026-08-07T10:27:05.594716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T10:27:05.598090Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.598090Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:5810c6c3265188f15b32b17d3d16b5b945bc311eac380cc229166299e1d7d1e2","observation_id":"8debd7c1-08a0-4b71-8179-253c635383c6","resolution":{"observed_at":"2026-08-07T10:27:05.598090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.484120Z","title":"Introducing gpt-4.1 in the api, 2025","venue":null,"work_id":"f568c192-da07-43ee-8f73-3b3f7dc4726e","year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.601374Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:f3b879b41a4df2a0eebe530e432930c6058b033eb96d0aadee6788c513f1644b","observation_id":"6435e326-212d-41e0-b84e-7df8a253e2bb","resolution":{"observed_at":"2026-08-07T10:27:06.487558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T10:27:05.604689Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.604689Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:65893164894b0bbaa54fdd7876d6bf59d1383800ca1263188f4b136b93f96582","observation_id":"6d514cce-0015-4127-85dc-032e853a8a3c","resolution":{"observed_at":"2026-08-07T10:27:05.604689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T10:27:05.608221Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.608221Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:82fab1b55a8f04ec8353da26419ee5ba78454017d899c4c5dfe68a3b8dba8473","observation_id":"2d5d455d-553e-4098-aa0f-ffc0607bc6b7","resolution":{"observed_at":"2026-08-07T10:27:05.608221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-06T02:17:30.272046Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14818","snapshot_observed_at":"2026-08-07T10:27:05.611836Z","title":"Eagle 2: Building post-training data strategies from scratch for frontier vision-language models.arXiv preprint arXiv:2501.14818, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.611836Z"},"links":{"cited_paper":"/paper/2501.14818","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:75534e5503bed24ad15070137d82cd65847cf617bf0f9154d84394263520ace2","observation_id":"8ee657c0-142e-46e5-abb7-0f73ee36fc1f","resolution":{"observed_at":"2026-08-07T10:27:05.611836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-07T10:27:05.618482Z","title":"Internvideo2.5: Empowering video mllms with long and rich context modeling.arXiv preprint arXiv:2501.12386, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.618482Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:24a4502380e0583b617ebaf64f8357d8f5988900c875fbefd2aa521b3d2aa25e","observation_id":"8cf9e3ab-02f8-44a7-a346-1c46941f6bbd","resolution":{"observed_at":"2026-08-07T10:27:05.618482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00574","last_updated":"2025-07-13T16:21:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-31T18:01:23Z","title":"VideoChat-Flash: Hierarchical Compression for Long-Context Video Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00574","snapshot_observed_at":"2026-08-07T10:27:05.621901Z","title":"Videochat-flash: Hierarchical compression for long-context video modeling.arXiv preprint arXiv:2501.00574, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.621901Z"},"links":{"cited_paper":"/paper/2501.00574","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:a820158beed0f42c62c0df93b7f84a4ee7967db08a1198d7936d66b030a24731","observation_id":"1746ded8-6795-49d0-871f-472260bf428f","resolution":{"observed_at":"2026-08-07T10:27:05.621901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-07T10:27:05.625899Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.625899Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:ceb3d1db7195266d5b99f298d30be5c6ebe3d60395e4c2b4fa8b1935894333ea","observation_id":"dc908336-520b-4e60-8078-7f6460e1aaf8","resolution":{"observed_at":"2026-08-07T10:27:05.625899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.629557Z","title":"Avqa: A dataset for audio-visual question answering on videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.629557Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:1e216e95737eb691d48cc2956b35e67f4100aac461fd3153ab0cbde8c820c325","observation_id":"27005343-43db-4f9d-864c-8a8fd57809ca","resolution":{"observed_at":"2026-08-07T10:27:05.629557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.633066Z","title":"Learning to answer questions in dynamic audio-visual scenarios","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.633066Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:0cec6f461abe3459e94e9ab76bc4d3649274327b6f43e83d6fd0d3755406cbe1","observation_id":"5a2c7e4d-0bfa-46c4-be84-db3f5867773a","resolution":{"observed_at":"2026-08-07T10:27:05.633066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.460438Z","title":"Audio-visual event localization in unconstrained videos","venue":null,"work_id":"5454879f-e276-4dc2-9612-68a67ab1e0b4","year":2018},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.636748Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:3c4834bc0cba4181228109352895ce5bdb457446244cd6a3c20c78c5faba8a7f","observation_id":"872115b7-75bf-42ad-94ca-e787115101ca","resolution":{"observed_at":"2026-08-07T10:27:06.463851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.450422Z","title":"Dense-localizing audio-visual events in untrimmed videos: A large-scale benchmark and baseline","venue":null,"work_id":"62e02810-4677-410d-92c5-081f79bb8ae3","year":2023},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.639954Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:e5ad543e04da2a3f10b65686f547640f2ae150492f97b16bf2fbaacd84d8217d","observation_id":"2fcdf031-2400-4683-a35c-832a7b127ab2","resolution":{"observed_at":"2026-08-07T10:27:06.453872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04598","last_updated":"2021-06-21T10:56:29Z","snapshot_observed_at":"2026-07-06T10:58:11.204048Z","submitted_at":"2021-04-03T07:07:21Z","title":"Cross-Modal learning for Audio-Visual Video Parsing","version":2},"cited_work":{"arxiv_id":"2104.04598","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.04598","snapshot_observed_at":"2026-08-07T10:27:05.822980Z","title":"Cross-Modal learning for Audio-Visual Video Parsing","venue":"cs.SD","work_id":"2593efd4-564f-4bb6-a287-9add728d504e","year":2021},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.643589Z"},"links":{"cited_paper":"/paper/2104.04598","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:1029bc2b3d6f3bccf3dfdd649a5e802bd919931f16bdcd9486c428f94855efe4","observation_id":"3ad08ab3-41c1-486e-8ab4-6402bbae9db1","resolution":{"observed_at":"2026-08-07T10:27:05.828372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.439951Z","title":"Audio-visual segmentation with semantics.International Journal of Computer Vision, pages 1–21, 2024","venue":null,"work_id":"6a0d00a4-82a9-43eb-9cab-a13f0121d686","year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.647139Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:3f1017a5621c82011ff9c72d8c4a855676d2a05b1e302fcc132733f5ee2afd14","observation_id":"fe57144d-5fa1-42e1-8c75-b318be294a27","resolution":{"observed_at":"2026-08-07T10:27:06.443673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.430018Z","title":"Enhancing geometric factors in model learning and inference for object detection and instance segmentation.IEEE transactions on cybernetics, 52(8):8574–8586, 2021","venue":null,"work_id":"8078d56a-bfd1-4861-8f2a-5f92b70c5c3c","year":2021},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.650416Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:abf62af397dde1e9c0f7c03d4b56f55303bb887e553f41181d68d7c2c051e468","observation_id":"100a54ff-3995-45cd-b92f-440fe0f4a08f","resolution":{"observed_at":"2026-08-07T10:27:06.433369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.420471Z","title":"URL https: //www-cdn.anthropic.com/de8ba9b01c9ab7cbabf5c33b80b7bbc618857627/Model_ Card_Claude_3.pdf","venue":null,"work_id":"d9682421-b530-43de-910a-39550d3de4bf","year":null},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.653489Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:c60a84e205eafa6d23b5a2d257c74c008ab3ddfd5f85ab53e8d820f4623ffc6e","observation_id":"cc351f6b-87d6-47af-a2fa-68c710048516","resolution":{"observed_at":"2026-08-07T10:27:06.423501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.657817Z","title":"Onellm: One framework to align all modalities with language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.657817Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:009614c20da187f666eaadbf95d28efea707dc88b322c458a8566397800bf0fd","observation_id":"ab692d4d-79fa-40b9-b859-571f1388fd5e","resolution":{"observed_at":"2026-08-07T10:27:05.657817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06071","last_updated":"2024-03-05T14:36:12Z","snapshot_observed_at":"2026-07-30T19:32:30.807724Z","submitted_at":"2024-01-11T17:41:57Z","title":"GroundingGPT:Language Enhanced Multi-modal Grounding Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06071","snapshot_observed_at":"2026-08-07T10:27:05.661256Z","title":"Groundinggpt: Language enhanced multi-modal grounding model.arXiv preprint arXiv:2401.06071, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.661256Z"},"links":{"cited_paper":"/paper/2401.06071","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:4a5dea9a5b2ebc9bdc9e2ce5cf52551a44ba11d61cf02e5ca76289b4f8477dad","observation_id":"71987732-166b-49b7-b8f0-00bddd142d99","resolution":{"observed_at":"2026-08-07T10:27:05.661256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.404083Z","title":"Valor: Vision-audio-language omni-perception pretraining model and dataset.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":"f303cb94-ed8f-408a-911f-61e571bf7c1a","year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.664610Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:77bbc3097c4ce6cdb012e55932e26cd4d066f1d864fd95d84dfc116b68d70467","observation_id":"6005d5e9-493a-467d-9ed5-a8d3c08c7d5d","resolution":{"observed_at":"2026-08-07T10:27:06.407310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.394289Z","title":"X-instructblip: A framework for aligning image, 3d, audio, video to llms and its emergent cross-modal reasoning","venue":null,"work_id":"1536f6ab-5173-41d2-a306-67a51618d84f","year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.667783Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:e289eab126c49b8d5b8d0c40133f4424aca674adc8823ba1bfe1a7531214d239","observation_id":"a29cf447-a518-4291-b3eb-d092abc80390","resolution":{"observed_at":"2026-08-07T10:27:06.397918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.383860Z","title":"Avicuna: Audio-visual llm with interleaver and context-boundary alignment for temporal referential dialogue.arXiv e-prints, pages arXiv–2403, 2024","venue":null,"work_id":"2cdd65f9-d519-4d55-87c6-c2c4e9d24ede","year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.670950Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:2696c4e4a123123aca2f7bde30f632927742fc21692856e118423eac6c27c2bf","observation_id":"c550d55b-4f9b-4f2d-89a0-50e4a988721a","resolution":{"observed_at":"2026-08-07T10:27:06.387217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02611","last_updated":"2024-12-03T17:41:23Z","snapshot_observed_at":"2026-07-06T20:01:01.384985Z","submitted_at":"2024-12-03T17:41:23Z","title":"AV-Odyssey Bench: Can Your Multimodal LLMs Really Understand Audio-Visual Information?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02611","snapshot_observed_at":"2026-08-07T10:27:05.674331Z","title":"Av-odyssey bench: Can your multimodal llms really understand audio-visual information?arXiv preprint arXiv:2412.02611, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.674331Z"},"links":{"cited_paper":"/paper/2412.02611","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:0ae0ea3c1a06be74cb346371a3bb1132ffe44940d47cb30ca9e2853192ef242a","observation_id":"484f6ce8-fdd9-4447-b52b-7e1f6f78b46d","resolution":{"observed_at":"2026-08-07T10:27:05.674331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:05.677898Z","title":"Omnibench: Towards the future of universal omni-language models.arXiv preprint arXiv:2409.15272, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.677898Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:52e8e63aee9226f202840f274a220fb3b2a501e4c5aeddc3426f6f83a095c807","observation_id":"0b5835ec-d2b5-4b49-8558-da2721948a9c","resolution":{"observed_at":"2026-08-07T10:27:05.677898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T10:27:05.680865Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.680865Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:e3cad23e1c1c986e3964b95f0678c803c4819ae4b060cbaae1abe0d3113151f0","observation_id":"5dc4b245-3c20-459a-9398-0aedc32eeaa4","resolution":{"observed_at":"2026-08-07T10:27:05.680865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.374062Z","title":"How many people spoke in the scene showing the conference table?","venue":null,"work_id":"f6c54fb4-3e5c-4c2c-9c51-85846839454e","year":2022},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.684003Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:fa5d0b1073841a3166a82b8bf439a20eeb2feb1c0b2586c55d103f6ed55157fb","observation_id":"0b62d6ce-670d-4aac-9cc7-e14526b3520e","resolution":{"observed_at":"2026-08-07T10:27:06.377743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.364520Z","title":null,"venue":null,"work_id":"33c34238-e8a1-4c57-9fac-571d737a6bca","year":null},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.687707Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:5afaac45a53482fb32ab57671f44d824ae80520dd6e7d58577128ecfb587a539","observation_id":"b2e7becb-f94b-4077-a055-9a04c361c860","resolution":{"observed_at":"2026-08-07T10:27:06.367572Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.354322Z","title":null,"venue":null,"work_id":"dcb21f00-aa9e-4236-9d09-8d9314660e3d","year":null},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.691318Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:8d885fe1ff6c26c2c385f6541281f942f165e492c4cd15d8c66cdcaf70068bbb","observation_id":"466bba4f-c527-4377-93ee-848320097d79","resolution":{"observed_at":"2026-08-07T10:27:06.357940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.344885Z","title":null,"venue":null,"work_id":"9a5615a5-1373-49ea-b99e-2e0d1cb3e4a9","year":null},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.694655Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:8c5c5a90aa9e2d0c42a034555026a42bf9da9e2677064d0a78fc3a6864070e33","observation_id":"6181835e-8342-4651-8f75-1f781fa56004","resolution":{"observed_at":"2026-08-07T10:27:06.347782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.335746Z","title":null,"venue":null,"work_id":"80867a7e-7f67-4d45-ae57-83c6bbf6d344","year":null},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.697979Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:5dae86805cbce8d2be22e755c6681ce0b0a302b010897b487f36711862902a45","observation_id":"24fcc273-cade-443a-a195-8b8c300f5146","resolution":{"observed_at":"2026-08-07T10:27:06.338960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.325746Z","title":null,"venue":null,"work_id":"ba044a5e-4109-4ab3-8248-8b564630d18b","year":null},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.701456Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:171a807d6887eb482fce3952ab3dfaf085d976b44f2118ab2809e0ff5279ba28","observation_id":"4cc85d94-89fc-4989-bc42-0e2dc4b9a040","resolution":{"observed_at":"2026-08-07T10:27:06.328979Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.316436Z","title":null,"venue":null,"work_id":"19df56b9-2ea1-40ea-9125-c503b1374037","year":null},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.705052Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:69e06abea90274017920f9058f8fe31716cb9cbd5125b4cb3ea654c6ce072d3d","observation_id":"30856085-49c4-4a07-912b-1ea40b179069","resolution":{"observed_at":"2026-08-07T10:27:06.319383Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:27:06.306530Z","title":"question","venue":null,"work_id":"bcb9aa54-4131-4cfd-8821-3e7ef0671c8d","year":null},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.708277Z"},"links":{"citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:29357396508bd28a91d177dfe2b7bb34e1a448efa9b18be8422ba537f8221ba6","observation_id":"476f044f-235e-4f69-b4dd-82d77e9b3a79","resolution":{"observed_at":"2026-08-07T10:27:06.309524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T11:49:44.536475Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":3,"verified_fuzzy":15},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 7 inbound Pith citation observations for arXiv:2506.05328."}