{"as_of":"2026-08-07T19:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cade9af28097157c072539f19ee71fa119b78af438c868da851065796fbadb2a","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T12:58:56.555335Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.28035/citation-record","integrity":"/paper/2605.28035/integrity","json":"/paper/2605.28035/citation-record.json","paper":"/paper/2605.28035"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09344","last_updated":"2025-06-11T02:50:49Z","snapshot_observed_at":"2026-08-07T12:51:38.948660Z","submitted_at":"2025-06-11T02:50:49Z","title":"Ming-Omni: A Unified Multimodal Model for Perception and Generation","version":1},"cited_work":{"arxiv_id":"2506.09344","doi":"10.48550/arxiv.2506.09344","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09344","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ming-omni: A unified multimodal model for perception and generation","venue":"ArXiv.org","work_id":"eba4dae2-6087-4ecf-ba38-9ab784c1b9a7","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2506.09344","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:9487577ce1d58e97de16f69d4185764a4e8538a04bd1978539f428401e77ffed","observation_id":"d996737e-1647-4160-bc43-d7ba78b8ea99","resolution":{"observed_at":"2026-06-29T13:03:26.238741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.21094","last_updated":"2026-06-02T17:15:46Z","snapshot_observed_at":"2026-08-06T21:10:12.336800Z","submitted_at":"2025-12-24T10:30:35Z","title":"T2AV-Compass: Towards Unified Evaluation for Text-to-Audio-Video Generation","version":2},"cited_work":{"arxiv_id":"2512.21094","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.21094","snapshot_observed_at":"2026-07-02T22:17:26.093228Z","title":"T2av-compass: Towards unified evaluation for text-to-audio-video generation","venue":"cs.CV","work_id":"f4d29773-29d6-486a-8faa-73376b01dd55","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2512.21094","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:67e1c4c57b7f1c314d12ee342409f02bca3f15045161db1244646e92617aff84","observation_id":"3fcfb654-6fd3-4980-9861-2054e302bd18","resolution":{"observed_at":"2026-06-29T13:03:26.236094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":"2406.07476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-07-04T16:49:57.279303Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","venue":"cs.CV","work_id":"ccfc3f89-c510-45f1-8a35-ed1a56c0ae5c","year":2024},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:c03740e1a9089562c86304309e4b6d61f16e0cb0de3bf1f472a4c82b02be0972","observation_id":"6d1fa948-c93a-40e5-90b3-d3e1ff661f68","resolution":{"observed_at":"2026-06-29T13:03:26.241165Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T12:58:56.555335Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:69ba6ca5eeb252c152a450e98ad9d85a2b472db71d6f6a9e6da06d8a1b298719","observation_id":"8079da02-09ee-4680-acaa-adbe46529f3c","resolution":{"observed_at":"2026-06-29T12:58:56.555335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09113","last_updated":"2025-06-28T11:58:23Z","snapshot_observed_at":"2026-08-01T16:09:18.068564Z","submitted_at":"2025-06-10T17:56:11Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","version":2},"cited_work":{"arxiv_id":"2506.09113","doi":"10.48550/arxiv.2506.09113","metadata_source":"pith","pith_arxiv_id":"2506.09113","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","venue":"cs.CV","work_id":"b2e36b5d-99e4-45b4-9358-64f6d3501983","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2506.09113","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:baffb09661da31ec8f00d896d10cf90b93c7e6e4716241d2cc01e1c67bd21dc0","observation_id":"cc94ef7f-e915-4333-9d95-97c365fd6276","resolution":{"observed_at":"2026-06-29T13:03:26.191814Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.12160","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T06:29:36.885838Z","title":"Dreamid-omni: Unified framework for controllable human-centric audio-video generation","venue":null,"work_id":"68a86102-576d-488e-8468-d7d87f76624f","year":2026},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:1f2aef98357651dca2d2a4d2b34608d8c6f3bf51c32aeae229950a723e1b65c7","observation_id":"5bf2fb70-140e-438e-80db-2cd6529b1a93","resolution":{"observed_at":"2026-06-29T13:03:26.231024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T12:58:56.555335Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:b6eabadecf006844433a900d7967ed113009386d3aecaa9c06ccd21560e4d087","observation_id":"794bee71-30bf-4899-8050-23aa302004a6","resolution":{"observed_at":"2026-06-29T12:58:56.555335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03233","last_updated":"2026-01-06T18:24:41Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2026-01-06T18:24:41Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","version":1},"cited_work":{"arxiv_id":"2601.03233","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.03233","snapshot_observed_at":"2026-07-10T01:46:41.047035Z","title":"LTX-2: Efficient Joint Audio-Visual Foundation Model","venue":"cs.CV","work_id":"1334671f-ee98-4c53-a1d4-0805281f8d2b","year":2026},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2601.03233","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:c0cbfdddafd08b396ad3085abbe93baf349f311296aef35af05a889aa7461e02","observation_id":"226454b4-b263-4e3c-9a84-d70393c2e086","resolution":{"observed_at":"2026-06-29T13:03:26.228415Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T12:58:56.555335Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:45d786e275d8b2a8d78e8605dd519a7c8b3802ebbc338b693ccbc90b9462db15","observation_id":"9ed236eb-3aba-48ee-ba01-cef4c48cd8f6","resolution":{"observed_at":"2026-06-29T12:58:56.555335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.21579","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:07:28.143954Z","title":"Harmony: Harmonizing audio and video generation through cross-task synergy","venue":null,"work_id":"2ee404a6-4351-42e2-b890-4024fc23222b","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:0cf307c2dd3b49717808f34c2f149e1dc2de1a8b9f685bb43402a05b9900b0f2","observation_id":"a780d5c7-ca67-449b-a4b1-70a483570ef7","resolution":{"observed_at":"2026-06-29T13:03:26.233544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.09299","last_updated":"2026-04-06T13:16:33Z","snapshot_observed_at":"2026-07-06T22:38:35.387503Z","submitted_at":"2025-12-10T03:57:29Z","title":"VABench: A Comprehensive Benchmark for Audio-Video Generation","version":2},"cited_work":{"arxiv_id":"2512.09299","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.09299","snapshot_observed_at":"2026-07-05T12:41:04.378368Z","title":"VABench: A Comprehensive Benchmark for Audio-Video Generation","venue":"cs.CV","work_id":"0b1e3c4c-ed41-4a5d-aee8-471b82e5072a","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2512.09299","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:207dcba9ae83c2943e300398670569ed067c3191cb64536f47d873d5a485cf40","observation_id":"c14d5e62-6023-4812-bec0-614c49b065f7","resolution":{"observed_at":"2026-06-29T13:03:26.244286Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18899","last_updated":"2025-06-23T17:59:16Z","snapshot_observed_at":"2026-08-06T23:12:29.382105Z","submitted_at":"2025-06-23T17:59:16Z","title":"FilMaster: Bridging Cinematic Principles and Generative AI for Automated Film Generation","version":1},"cited_work":{"arxiv_id":"2506.18899","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.18899","snapshot_observed_at":"2026-07-04T14:59:55.963228Z","title":"Filmaster: Bridging cinematic principles and generative ai for automated film generation","venue":null,"work_id":"769dc373-eac3-4e63-91bd-f49ede418870","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2506.18899","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:196013cc8f9078c5f9163654a5f0033d44e670443d82166939452a55d61b568c","observation_id":"ad7114ac-5690-4e94-bb4a-3ec72a36e83e","resolution":{"observed_at":"2026-06-29T13:03:26.223186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T12:58:56.555335Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:e5f800ba4b2c3f3f8992dd69693d3a2cb2d8ae2eaaa76c4e933053b791688dac","observation_id":"f7845cc7-776a-4722-9511-7b6a38dda052","resolution":{"observed_at":"2026-06-29T12:58:56.555335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19474","last_updated":"2026-07-07T10:11:01Z","snapshot_observed_at":"2026-08-03T20:53:20.266436Z","submitted_at":"2025-11-22T07:37:21Z","title":"Pistachio: Towards Synthetic, Balanced, and Long-Form Video Anomaly Benchmarks","version":6},"cited_work":{"arxiv_id":"2511.19474","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.19474","snapshot_observed_at":"2026-06-29T13:03:26.217911Z","title":"Pistachio: Towards Synthetic, Balanced, and Long-Form Video Anomaly Benchmarks","venue":"cs.CV","work_id":"d81d9f93-9d36-4ea5-9480-e32fa7071a3c","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2511.19474","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:37c9ebc3c34dc7f11c530c5d2c91436fd85e2677855749b209ffcc21d3618c09","observation_id":"3e802ede-811e-44fd-82a2-6f22cc443071","resolution":{"observed_at":"2026-06-29T13:03:26.219716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.01481","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:19:47.472363Z","title":"Videohallu: Evaluating and mitigating multi- modal hallucinations on synthetic video understanding","venue":null,"work_id":"44c11ef7-43f9-443d-9d45-0306a86d971d","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:5e5d1b82726371e0f11b939a8557eba1ce06bf33d3ccf204cdb04ed306cbe013","observation_id":"c306501b-2e4a-429a-9e70-1d971f74f35c","resolution":{"observed_at":"2026-06-29T13:03:26.215950Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15091","last_updated":"2024-07-12T18:03:29Z","snapshot_observed_at":"2026-08-03T11:40:16.152962Z","submitted_at":"2023-09-26T17:36:26Z","title":"VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning","version":2},"cited_work":{"arxiv_id":"2309.15091","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.15091","snapshot_observed_at":"2026-07-04T14:59:55.973287Z","title":"Videodirectorgpt: Consistent multi-scene video generation via llm-guided planning","venue":null,"work_id":"386fe0af-d0c9-4b38-a690-55b83415dbe2","year":2023},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2309.15091","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:b9e4f3dc4296255500f6c63e43c22e7e4aa675ca16d59b055841f4e18c9e64c7","observation_id":"2e682433-2b29-4acf-8a57-9cf0fad346ae","resolution":{"observed_at":"2026-06-29T13:03:26.236751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.22905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T13:03:26.250990Z","title":"arXiv preprint arXiv:2512.22905 , year=","venue":null,"work_id":"a86a1454-5c23-4f45-8654-39bf9fa52d0d","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:06876da5f5b4d32b93387f935c6d2d03641b09dce8162df29a993ac20177db5a","observation_id":"90ea86ce-b87e-400d-8135-a28616103c0e","resolution":{"observed_at":"2026-06-29T13:03:26.252283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.23377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:41:04.381869Z","title":"JavisDiT: Joint audio-video diffusion transformer with hierarchical spatio-temporal prior synchronization","venue":null,"work_id":"3b03d007-725f-4692-9648-a2785e1e2398","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:443178484e2b6d4a99b2b69b620f2bb9b71720874cb899758a4fae1ae8eed181","observation_id":"4f470280-bd12-446a-8b70-6c1a34f32946","resolution":{"observed_at":"2026-06-29T13:03:26.249648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.19163","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:48:55.709500Z","title":"Ilya Loshchilov and Frank Hutter","venue":null,"work_id":"59aaef1a-efc0-4078-b139-ac7e5a7c58f9","year":2026},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:6bafb87dbf868678fb49e96c6baa041d425c11f25fd770a9da93e06b1b68bc4c","observation_id":"80b66b69-d84f-4f50-ae59-f7691fadfb03","resolution":{"observed_at":"2026-06-29T13:03:26.229730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04328","last_updated":"2025-06-02T19:33:24Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:55Z","title":"Ola: Pushing the Frontiers of Omni-Modal Language Model","version":3},"cited_work":{"arxiv_id":"2502.04328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04328","snapshot_observed_at":"2026-07-04T16:49:57.266999Z","title":"Llavanext: Improved reasoning, ocr, and world knowledge, 2024a","venue":null,"work_id":"96573241-2351-4fa6-b8a3-a387a61dbd60","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2502.04328","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:53a2b2cd3e6fca41bac8dbe1999bb1954557cd646d007c6218a4f87e59e95470","observation_id":"1ed0ee24-4c98-4e50-97f0-f325d22baf69","resolution":{"observed_at":"2026-06-29T13:03:26.177260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-06T11:49:53.749464Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"cited_work":{"arxiv_id":"2510.01284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.01284","snapshot_observed_at":"2026-07-05T12:41:04.361399Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","venue":"cs.MM","work_id":"4ea3b1fc-d272-47f2-88a8-36cbeaa92448","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2510.01284","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:7262ae004e7bef005a05f6c6a3c41cf8d1b8e455a0aeb81849267a26f4cde62b","observation_id":"7b1cb8d3-7c8c-4408-950c-54e13f96b9ae","resolution":{"observed_at":"2026-06-29T13:03:26.246924Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T12:58:56.555335Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:1439cf67f269ac5666c0254e6e95696bf6d6c549279276633cc63d58f4ec507b","observation_id":"0824869e-f536-44fd-9b9d-6f0dcabdf8bd","resolution":{"observed_at":"2026-06-29T12:58:56.555335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.17737","last_updated":"2026-05-27T06:53:57Z","snapshot_observed_at":"2026-08-07T17:02:56.952261Z","submitted_at":"2026-01-25T08:10:28Z","title":"The Script is All You Need: An Agentic Framework for Long-Horizon Dialogue-to-Cinematic Video Generation","version":3},"cited_work":{"arxiv_id":"2601.17737","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.17737","snapshot_observed_at":"2026-07-02T20:57:23.140793Z","title":"The script is all you need: An agentic framework for long-horizon dialogue-to- cinematic video generation","venue":"cs.CV","work_id":"11c1c3a4-441c-4285-8e0a-069959a7d7c3","year":2026},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2601.17737","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:6e2e0d7ff2f1d92d3b4f69e42fdfc47c71808bdd6245594ced55ee2fd60060dc","observation_id":"b9d8c680-87be-4c13-b1dc-10df713092d4","resolution":{"observed_at":"2026-06-29T13:03:26.259600Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T12:58:56.555335Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:5002d2deba9a2fd18cdc589626e058206144c0a3f8881cee6ae0837bf7ed68d2","observation_id":"2afe3338-8d00-447e-b115-9e3c55508205","resolution":{"observed_at":"2026-06-29T12:58:56.555335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.23969","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:18:58.068563Z","title":"Msvbench: Towards human-level evaluation of multi-shot video generation.arXiv preprint arXiv:2602.23969","venue":null,"work_id":"d36a8679-3b8b-43f5-aad5-e5a9e27a80af","year":2026},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:3feab545cb00a5811e797b66e6f68410c69a1d2d62fbbe007effec7668767eff","observation_id":"7cd7a621-9897-4692-a21b-cbc81e41cab5","resolution":{"observed_at":"2026-06-29T13:03:26.222737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T12:58:56.555335Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:dc71ba9d892fce508c296f64463ef9555ade41cb274dc7417aa20998dbf47781","observation_id":"b9845e67-36c4-437f-8a7c-b6dff77c68fd","resolution":{"observed_at":"2026-06-29T12:58:56.555335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:a2105f8e7ddb8f330729f77a513f371920a91658de38726b7b2ce90413e981de","observation_id":"eb939407-c196-466e-a1d2-1aa110cc10b8","resolution":{"observed_at":"2026-06-29T13:03:26.257138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.08794","doi":"10.48550/arxiv.2602.08794","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mova: Towards scalable and synchronized video-audio generation","venue":"Open MIND","work_id":"1ec90ca8-482d-433a-94ad-2005f2c6fe8f","year":2026},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:fdefc6e62891a514f57cb99e8433e33adf52d31ccb0d00e8269b9cc5da6ad1a6","observation_id":"218e493d-2697-403d-b04d-dc34ee948ff2","resolution":{"observed_at":"2026-06-29T13:03:26.198221Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06155","last_updated":"2025-09-07T17:55:03Z","snapshot_observed_at":"2026-08-05T00:05:44.790684Z","submitted_at":"2025-09-07T17:55:03Z","title":"UniVerse-1: Unified Audio-Video Generation via Stitching of Experts","version":1},"cited_work":{"arxiv_id":"2509.06155","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.06155","snapshot_observed_at":"2026-07-05T12:41:04.336871Z","title":"UniVerse-1: Unified audio-video generation via stitching of experts","venue":"cs.CV","work_id":"b460dec5-ca31-4982-8dc8-769dad75efb5","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2509.06155","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:a7d14f02ea75a57239679ebf515e86008d5736ee8648615c6db02770331384f0","observation_id":"98534943-92e7-479d-963b-19192e9337b9","resolution":{"observed_at":"2026-06-29T13:03:26.184000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15145","last_updated":"2025-05-21T06:02:39Z","snapshot_observed_at":"2026-08-07T15:20:53.427654Z","submitted_at":"2025-05-21T06:02:39Z","title":"CineTechBench: A Benchmark for Cinematographic Technique Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2505.15145","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.15145","snapshot_observed_at":"2026-07-04T17:40:00.908480Z","title":"Cinetechbench: A benchmark for cine- matographic technique understanding and generation","venue":null,"work_id":"87f2cf3e-085c-4220-860d-db3212995522","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2505.15145","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:837e86b7a960a77b8cff812d91cba07fce302ba6a241f1f1fe3530c7c8e198cc","observation_id":"69be12ea-83b4-4c50-837b-695bcb86fd61","resolution":{"observed_at":"2026-06-29T13:03:26.207486Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T12:58:56.555335Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:2335667a059ad0feb7528a01350e646930a46b2e164f587325652faddefe6638","observation_id":"05bbf75b-5655-4a5e-a6f5-65765e41d172","resolution":{"observed_at":"2026-06-29T12:58:56.555335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T12:58:56.555335Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:955a2015d82e6f4ee42d880068d526af5bab006c628e640963ec12380e995f17","observation_id":"e536ebd5-a872-4879-9f74-ac5354683788","resolution":{"observed_at":"2026-06-29T12:58:56.555335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.23994","last_updated":"2026-05-18T09:30:21Z","snapshot_observed_at":"2026-07-06T22:40:23.205898Z","submitted_at":"2025-12-30T05:22:31Z","title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","version":4},"cited_work":{"arxiv_id":"2512.23994","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.23994","snapshot_observed_at":"2026-07-05T12:41:04.333890Z","title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","venue":"cs.SD","work_id":"f195e204-6846-46de-9de8-8ed43724d874","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2512.23994","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:48d50ebf7b27e9bdce492f18796b992306e77f343ad00be6f9efde2621c1302b","observation_id":"30d9c036-7968-40e1-84b9-c98cba14d4b6","resolution":{"observed_at":"2026-06-29T13:03:26.254615Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:07b462fc17ef120872557b0d7adf8c645a9467433957c8bec91a3645ae989f09","observation_id":"f7c462d1-fa92-40dc-aa23-d4ca554a93cc","resolution":{"observed_at":"2026-06-29T13:03:26.210047Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T12:58:56.555335Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:f737c46c56ab72decb8d846420a6de78718558a1c9a8b409d6ad6f6e3f760974","observation_id":"afbcdca5-3e41-4068-9988-0afc170b8d90","resolution":{"observed_at":"2026-06-29T12:58:56.555335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:20e9fb2dc4c11a03a939fbbe362682063198523a18dfd6871eb6b694954f97d6","observation_id":"6d843190-f90b-4f3e-8762-132016adea2c","resolution":{"observed_at":"2026-06-29T13:03:26.231759Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.15870","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:49:57.263774Z","title":"Omnivinci: Enhancing architecture and data for omni-modal understanding llm","venue":null,"work_id":"6179c0bb-4911-4be4-89c8-a387d39c8459","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:25fa03ff4acad37cbe1ba96158550a3d68c38bd662390f2a6d0cfb2c209366d7","observation_id":"2c7fbfed-cd5d-45ec-976f-788ac5a940a5","resolution":{"observed_at":"2026-06-29T13:03:26.227450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T12:58:56.555335Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:6fa7e78cd485527c2ba780ea2aaa3750efcc5bc14463382783c27c6da6525ca3","observation_id":"5c810940-7eda-44d9-b55c-ab5127162797","resolution":{"observed_at":"2026-06-29T12:58:56.555335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.03334","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T12:41:04.312298Z","title":"arXiv preprint arXiv:2511.03334 (2025)","venue":null,"work_id":"de68a5e3-41de-4728-9038-0f1ed7b7039c","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:aaf3ff1c467dacce89fe81b0865ae06f158fd24c25c07a396971e1c55f305b8b","observation_id":"04fa848d-a2bd-4fa8-a11f-8c0ac2962f6b","resolution":{"observed_at":"2026-06-29T13:03:26.189340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.12372","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T14:59:55.999898Z","title":"Stage: Storyboard- anchored generation for cinematic multi-shot narrative","venue":null,"work_id":"167b9b79-2099-41d6-964e-9c011c55f890","year":2025},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:0eb51f055e0f8cce074f1f4817059dd3544043ca0bde924291e6cdb6d96adc5f","observation_id":"8d181fff-f4e3-42ea-a15c-87cf0c474c7c","resolution":{"observed_at":"2026-06-29T13:03:26.239070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00607","last_updated":"2026-04-30T17:47:03Z","snapshot_observed_at":"2026-08-01T04:00:28.658425Z","submitted_at":"2026-01-31T08:50:32Z","title":"MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation","version":2},"cited_work":{"arxiv_id":"2602.00607","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.00607","snapshot_observed_at":"2026-07-05T12:41:04.321729Z","title":"MTAVG-Bench: A Diagnostic Benchmark for Multi-Talker Dialogue-Centric Audio-Video Generation","venue":"cs.MM","work_id":"49070cfd-0fac-4569-84a2-5db63373e889","year":2026},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2602.00607","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:506567cee5e287bbdab6037a987ea385dd29fd59dd5f61865522dd9955a413d9","observation_id":"c3751cfd-fbd3-4d96-a56c-fc2970ea0d74","resolution":{"observed_at":"2026-06-29T13:03:26.225709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08540","last_updated":"2026-04-09T17:59:39Z","snapshot_observed_at":"2026-08-02T21:13:25.946486Z","submitted_at":"2026-04-09T17:59:39Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","version":1},"cited_work":{"arxiv_id":"2604.08540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08540","snapshot_observed_at":"2026-07-03T00:07:28.033897Z","title":"AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation","venue":"cs.CV","work_id":"49aa4820-3ca7-4ee9-bac1-a9a8389e5c56","year":2026},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"cited_paper":"/paper/2604.08540","citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:626a1c52bee22e7137898fa790d4b7830d47dc0acb257b56fe30dfa508fc69e0","observation_id":"d12b254e-ca36-4bfe-9343-83bba87a0e4f","resolution":{"observed_at":"2026-06-29T13:03:26.186447Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T12:58:56.555335Z","title":"clip_summary","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T12:58:56.555335Z"},"links":{"citing_paper":"/paper/2605.28035"},"observation_digest":"sha256:ab0851088edeaa15abac9e39b5012c34d74b18fe4b855e32e07d42b4e01dca01","observation_id":"a9d52f46-6a57-4a80-ba83-d395486af217","resolution":{"observed_at":"2026-06-29T12:58:56.555335Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.28035","last_updated":"2026-05-27T06:38:54Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T15:04:58.209846Z","submitted_at":"2026-05-27T06:38:54Z","title":"MTAVG-Bench 2.0: Diagnosing Failure Modes of Cinematic Expressiveness in Multi-Talker Audio-Video Generation"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":31,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2605.28035."}