{"as_of":"2026-08-14T07:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d6e5521f29e624b1e322afefdc60149cfbfa22ef03ef868514145f51f48372dc","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T00:02:26.319596Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:29:05.574108Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T05:00:19.327534Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18314","snapshot_observed_at":"2026-08-06T15:29:05.574108Z","title":"Agav-rater: adapting large multimodal model for ai-generated audio-visual quality assessment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15709","last_updated":"2025-08-10T13:31:03Z","snapshot_observed_at":"2026-08-10T08:52:34.323238Z","submitted_at":"2025-07-21T15:17:01Z","title":"Efficient Face Image Quality Assessment via Self-training and Knowledge Distillation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:05.574108Z"},"links":{"cited_paper":"/paper/2501.18314","citing_paper":"/paper/2507.15709"},"observation_digest":"sha256:e2bfa1d1f605bbb29b032ef50bb016ed1261f25bc56e11e1b92b23b9e100f575","observation_id":"13e43b0e-11d7-4144-a940-7bd6e6e57ace","resolution":{"observed_at":"2026-08-06T15:29:05.574108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"cited_work":{"arxiv_id":"2501.18314","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.18314","snapshot_observed_at":"2026-08-06T05:00:19.327534Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","venue":"cs.MM","work_id":"64c9e5d8-4707-4a0d-98bc-aad8ec429f91","year":2025},"citing_paper":{"arxiv_id":"2508.02516","last_updated":"2025-08-10T13:22:26Z","snapshot_observed_at":"2026-08-13T09:27:29.266977Z","submitted_at":"2025-08-04T15:21:29Z","title":"Engagement Prediction of Short Videos with Large Multimodal Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T05:00:14.789121Z"},"links":{"cited_paper":"/paper/2501.18314","citing_paper":"/paper/2508.02516"},"observation_digest":"sha256:2a0bfa249a4f526365d2be3c7eb2b9c2258da26ad83bc18c9cbd0fd32b371d64","observation_id":"cfc4fff1-41c7-4d93-badb-65f6addd245b","resolution":{"observed_at":"2026-08-06T05:00:19.331823Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.18314/citation-record","integrity":"/paper/2501.18314/integrity","json":"/paper/2501.18314/citation-record.json","paper":"/paper/2501.18314"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.196499Z","title":"Prime Voice AI, 2023","venue":null,"work_id":"fff4ff23-f65a-4934-bee8-fc887cb784eb","year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.074865Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:31b548548185c39b39d972fa3b01ee90d5d35c593b28fbe9222926c6112836e7","observation_id":"fdf31bf0-5965-4ee2-8d37-07a1a9098af5","resolution":{"observed_at":"2026-08-10T00:02:27.200658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.183109Z","title":"Accessed December 28, 2023 [Online] https://www.pika.art/, 2023","venue":null,"work_id":"f19cd6a1-b462-4d7e-b326-ee5c0841ceee","year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.079755Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:bf0dced8978d83a141838ca80dfb874be5e66ec18a93370984b42f42d3a596f7","observation_id":"7c0b15e2-e613-4299-bc34-ce60acd262d7","resolution":{"observed_at":"2026-08-10T00:02:27.187743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.171438Z","title":"Accessed June 17, 2024 [Online] https://runwayml.com/research/introducing-gen-3-alpha, 2024","venue":null,"work_id":"b16b48c8-a233-4048-b296-71ac766cdeef","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.083409Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:62effeb4f65bf10d8e6de1ac38198332f5a5682460db25487358184e087cde5c","observation_id":"21cbe542-4314-4966-a68f-7f2eb23af791","resolution":{"observed_at":"2026-08-10T00:02:27.175505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.159951Z","title":"Accessed June 6, 2024 [Online] https://klingai.kuaishou.com/, 2024","venue":null,"work_id":"f49e9aa2-7fa3-47b0-88a4-20795a38e65e","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.086752Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:69a484279ca9f65560624e7b7eeb4282dea56e64e050c7a202f5026456ed348a","observation_id":"46e2f2ee-4c14-4881-a339-80f2d8423dca","resolution":{"observed_at":"2026-08-10T00:02:27.164098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.148240Z","title":"Accessed February 16, 2024 [Online] https://openai.com/sora/, 2024","venue":null,"work_id":"59675cbc-2f4f-4623-b1dd-8467a289c2fd","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.089994Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:a49bbfe468ce079d94368575fd37f4c8bcaff83b11dc9eb82ab72001a7c9e7d8","observation_id":"92a46a10-49f5-4508-8728-34d5a329ffb4","resolution":{"observed_at":"2026-08-10T00:02:27.152193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-14T02:16:19.922733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-10T00:02:26.093378Z","title":"I., Borsos, Z., Engel, J., Verzetti, M., Caillon, A., Huang, Q., Jansen, A., Roberts, A., Tagliasacchi, M., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.093378Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:bd9bb6010c81850ed6e4cabf4be8148ad8ce98ad5effae1237591364946368f5","observation_id":"67604226-62bc-4995-8c68-4cb83de72b8f","resolution":{"observed_at":"2026-08-10T00:02:26.093378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.137243Z","title":"G., Schmidmer, C., Berger, J., Obermann, M., Ullmann, R., Pomy, J., and Keyhl, M","venue":null,"work_id":"41eed6e6-781b-44ab-b9d7-81869e842297","year":2013},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.097895Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:cc012c9e9334b1efd6966b4d0c9f2dd4bdb2060e243e9c89ab1ab248354e78d0","observation_id":"54079295-2452-42d4-aea7-2fe544a8b568","resolution":{"observed_at":"2026-08-10T00:02:27.140844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.126614Z","title":"Attention-guided neural networks for full-reference and no-reference audio-visual quality assessment","venue":null,"work_id":"fc0e6778-9b97-42ed-92b8-b7b5f5237dee","year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.101036Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:6b84d79407140f0481541644526bcf70760e878a041cd62a9b0435aeafd1866c","observation_id":"b5aba429-cc3e-46f8-adc6-3f7f1351b3d9","resolution":{"observed_at":"2026-08-10T00:02:27.130287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.115202Z","title":"Subjective and objective audio-visual quality assessment for user generated content","venue":null,"work_id":"2c474687-cb10-4d29-bee5-1230ae6dc83f","year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.104801Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:b680ad8b83c96f280d0c88da5b887ba82e34d7552cb98446c4b3d1ffc3ab1342","observation_id":"0b5b111c-0ede-4c07-8e30-3bce1046ada1","resolution":{"observed_at":"2026-08-10T00:02:27.118856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16305","last_updated":"2024-04-26T02:23:24Z","snapshot_observed_at":"2026-08-13T00:22:38.018895Z","submitted_at":"2024-04-25T03:14:49Z","title":"Semantically consistent Video-to-Audio Generation using Multimodal Language Large Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16305","snapshot_observed_at":"2026-08-10T00:02:26.108555Z","title":"Semantically consistent video-to-audio generation using multimodal language large model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.108555Z"},"links":{"cited_paper":"/paper/2404.16305","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:eb168890136ab9cc69af82a7697f6fe7b18afd9d14acd52c81699b9e06a709a6","observation_id":"f8009c33-1708-4b14-8d49-2048beb884b1","resolution":{"observed_at":"2026-08-10T00:02:26.108555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.104422Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":"2b130b07-e6f4-43c3-a37a-0e898014247f","year":2020},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.112847Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:5d0c89bc67391d0188f8d24f5201eeb3b7a6eb15e02a9e060af5bcdd38c23f39","observation_id":"9f910086-50e1-41d5-bf02-9b05428547b6","resolution":{"observed_at":"2026-08-10T00:02:27.108116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.092395Z","title":"Vast: A vision-audio-subtitle-text omni-modality foundation model and dataset","venue":null,"work_id":"43961d49-3882-4d8b-997a-628b80e271d5","year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.116824Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:f5f126ce22069880b3629ce98b516e9d454827b1d1729ccd7a93e04e3833cb8b","observation_id":"f0af9eec-e1f8-4f70-a573-8304309ffba5","resolution":{"observed_at":"2026-08-10T00:02:27.096437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-10T00:02:26.120459Z","title":"VideoLLaMA 2 : Advancing spatial-temporal modeling and audio understanding in video-LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.120459Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:e8a6cc97070843fa49e17edb35b5b40eac23150dbcccf35dd949512e9ac7e7ce","observation_id":"9da84270-4d0e-43ae-a854-9f56b0425268","resolution":{"observed_at":"2026-08-10T00:02:26.120459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.080172Z","title":"Simple and controllable music generation","venue":null,"work_id":"99167179-4c8a-4dd5-a153-49ae96c4288c","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.124527Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:43ec028ab6324e8032b06dd9c3323f38d8a7cddf0e19fa4d1e361a1569437a24","observation_id":"8c990ca2-3e07-4f28-81de-fabe653a10d8","resolution":{"observed_at":"2026-08-10T00:02:27.084185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00282","last_updated":"2024-02-01T02:15:59Z","snapshot_observed_at":"2026-08-13T04:29:37.210189Z","submitted_at":"2024-02-01T02:15:59Z","title":"PAM: Prompting Audio-Language Models for Audio Quality Assessment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00282","snapshot_observed_at":"2026-08-10T00:02:26.128138Z","title":"A., Singh, R., Raj, B., and Wang, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.128138Z"},"links":{"cited_paper":"/paper/2402.00282","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:ae0aad031ea9ae139142213ec3c1638e2da551693f1e4e402caca0b8dbe366de","observation_id":"b185952f-2392-43f5-a3e2-bff21ac70847","resolution":{"observed_at":"2026-08-10T00:02:26.128138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.067728Z","title":"Toward universal text-to-music retrieval","venue":null,"work_id":"a22935be-3a92-47e9-a97e-5d8dd92d233c","year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.132102Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:513ef8f3db91259568dc62f8829d94dea9c78f77c0b0883560062e9474ea0bb1","observation_id":"5ea53f22-e938-4b26-8d79-e8b12116018a","resolution":{"observed_at":"2026-08-10T00:02:27.071912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.054631Z","title":"Clap learning audio concepts from natural language supervision","venue":null,"work_id":"baccb277-4901-4dd8-b010-f6f929c9b234","year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.135897Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:f6086479c95151185b8b1fded048c90b4a44b66239d4faf0e36e3492e5743816","observation_id":"9aaf1ed9-a3e1-4064-9eb8-702427f8af1f","resolution":{"observed_at":"2026-08-10T00:02:27.059316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05211","last_updated":"2025-05-30T12:57:16Z","snapshot_observed_at":"2026-08-12T23:05:52.455854Z","submitted_at":"2024-08-09T17:59:49Z","title":"VITA: Towards Open-Source Interactive Omni Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05211","snapshot_observed_at":"2026-08-10T00:02:26.139518Z","title":"Vita: Towards open-source interactive omni multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.139518Z"},"links":{"cited_paper":"/paper/2408.05211","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:2f50bd60ecfc7803a31fc047f8d926bde5478805855d83ef62c17d4ea172d227","observation_id":"7b3f034a-05a7-460c-97fd-1be3d9d0069f","resolution":{"observed_at":"2026-08-10T00:02:26.139518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15447","last_updated":"2025-08-12T04:20:41Z","snapshot_observed_at":"2026-08-12T14:15:26.579700Z","submitted_at":"2024-11-23T04:27:19Z","title":"Gotta Hear Them All: Towards Sound Source Aware Audio Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15447","snapshot_observed_at":"2026-08-10T00:02:26.143618Z","title":"Gotta hear them all: Sound source aware vision to audio generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.143618Z"},"links":{"cited_paper":"/paper/2411.15447","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:60cb77bd59fc047579dceb1b98593c177442b61f8a265e21cb69d9d610415dd0","observation_id":"f2e25c47-60b7-42a2-a8ee-70597ef18393","resolution":{"observed_at":"2026-08-10T00:02:26.143618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.042422Z","title":"AnimateDiff : Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":"4b9290ef-6daa-48ba-9137-e365b0aa8244","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.147525Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:6489a8ebc68f4806e7f4b9c12403d0ecdf37da1e6964ef009eee93b90df4977f","observation_id":"b1a8fd6b-f6cf-41f4-a5d7-5944ee8d1e82","resolution":{"observed_at":"2026-08-10T00:02:27.046444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.030937Z","title":"Onellm: One framework to align all modalities with language","venue":null,"work_id":"9ad36695-855d-4761-96ad-2ccd9023f9de","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.151192Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:faa5aa60c332a4e3b8a49cc325dc8756ec9612cecca4e5e40b5c7c1536ea180c","observation_id":"95381a4c-0dce-46b3-b59e-285693eb614e","resolution":{"observed_at":"2026-08-10T00:02:27.035546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.019157Z","title":null,"venue":null,"work_id":"3f1cc7af-f973-4116-be3a-dac33fc7415b","year":2007},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.154855Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:c205db5dffc75e9fba19a26cd5e2ac0c2c420ee0918bd6ed9dd6b5836e4516d9","observation_id":"9cc67da7-92c8-46f2-a49a-51bac96a791f","resolution":{"observed_at":"2026-08-10T00:02:27.023540Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-10T00:02:26.158614Z","title":"CogVideo : Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.158614Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:08392b6b67d75644f963e30d632685e0fb46a3c6d7acb53952e818f71e682b19","observation_id":"cefd2335-c222-4665-a4ee-3d47f23f13af","resolution":{"observed_at":"2026-08-10T00:02:26.158614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14709","last_updated":"2024-09-23T05:05:47Z","snapshot_observed_at":"2026-08-12T22:39:54.265826Z","submitted_at":"2024-09-23T05:05:47Z","title":"Video-to-Audio Generation with Fine-grained Temporal Semantics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14709","snapshot_observed_at":"2026-08-10T00:02:26.162701Z","title":"Video-to-audio generation with fine-grained temporal semantics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.162701Z"},"links":{"cited_paper":"/paper/2409.14709","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:c4bea1e1bd29981b3df50fc65816e14ede03f796e5ebf7fd1f8a8aa88ada4f67","observation_id":"53accb63-7a54-44d1-bfd5-4d6a6c717ec7","resolution":{"observed_at":"2026-08-10T00:02:26.162701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:27.005194Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":"c59e0fe5-552c-4711-8422-34eab90ec126","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.166500Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:32fff43c49834b5e254c57557b85a2c43cf4e78fd605142f8f09f9826f467235","observation_id":"5d45ad44-df55-4936-996f-d2a5faf2cf52","resolution":{"observed_at":"2026-08-10T00:02:27.009115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-10T00:02:26.171351Z","title":"P., Perelman, A., Ramesh, A., Clark, A., Ostrow, A., Welihinda, A., Hayes, A., Radford, A., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.171351Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:91933edcaa75141ae1fc5caa9a3989970574afe092a23d188cefceddaee550ab","observation_id":"073488ba-5728-47ff-9e5d-05e5cf7d8ba3","resolution":{"observed_at":"2026-08-10T00:02:26.171351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08791","last_updated":"2021-10-17T11:14:00Z","snapshot_observed_at":"2026-08-13T17:51:47.592172Z","submitted_at":"2021-10-17T11:14:00Z","title":"Taming Visually Guided Sound Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08791","snapshot_observed_at":"2026-08-10T00:02:26.175169Z","title":"and Rahtu, E","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.175169Z"},"links":{"cited_paper":"/paper/2110.08791","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:a1e7aafae697be6d732002563784a2e8bf3d0ea54b86390bec2741c486602963","observation_id":"e6f7b572-5f85-4443-939e-3414a4ad8fa8","resolution":{"observed_at":"2026-08-10T00:02:26.175169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.993048Z","title":"Read, watch and scream! sound generation from text and video","venue":null,"work_id":"a75713a7-ec1e-4419-aa22-24e6d6d9f128","year":2025},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.178962Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:b4a19167fd90bde60a85d5867c927f51035a02a96c76c36b87698650741acdb1","observation_id":"ad621faf-ae9f-4405-9a81-1df5f46d6ee6","resolution":{"observed_at":"2026-08-10T00:02:26.996922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.981391Z","title":"T2VBench : Benchmarking temporal dynamics for text-to-video generation","venue":null,"work_id":"20df1f41-33e9-4cce-b76d-25f3f38a6d3a","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.182673Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:2e2837a04c38f3ab1f2171dc5c808c9fd282f53c1647a0d795dff70c92cd018c","observation_id":"76f07674-9edd-45ae-86cc-f7209d1b0187","resolution":{"observed_at":"2026-08-10T00:02:26.985567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.969000Z","title":"D., Kim, B., Lee, H., and Kim, G","venue":null,"work_id":"161486ed-045c-4195-8f17-50b4d6e8a3a7","year":2019},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.185848Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:3e71f25a6eeff5894f04113d3fd088bba268e71a414f259430388f17ff381fcf","observation_id":"405c95da-158c-48a6-90e4-7c1e87db9807","resolution":{"observed_at":"2026-08-10T00:02:26.973264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.957931Z","title":"Subjective-aligned dataset and metric for text-to-video quality assessment","venue":null,"work_id":"2da2bbea-ceeb-47dd-b449-ae22639c6b7f","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.189063Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:1f132174b78f84ec5a9be076ee29075dad7899a7a138269b5512324ed5ded1dc","observation_id":"bc894573-ea6a-4ad9-8454-bd76e50531c5","resolution":{"observed_at":"2026-08-10T00:02:26.961500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-13T14:15:37.919179Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-10T00:02:26.192304Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.192304Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:08767ec80fa4e87aa74b6eb7d068ffa97936433a499394feb81784c212174adc","observation_id":"0423f0dc-9b3c-48f9-9046-375a6fed13ca","resolution":{"observed_at":"2026-08-10T00:02:26.192304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.947184Z","title":"Groundinggpt: Language enhanced multi-modal grounding model","venue":null,"work_id":"265fddfc-5496-4bcc-aabd-760a2d55e7c9","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.195824Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:2f6dffebf2e9a56159ad6ba9acceedec7c91ec5d757cf11ec3297fa8be2f6286","observation_id":"71c8e2b8-dd21-450b-910e-5d819958bc9a","resolution":{"observed_at":"2026-08-10T00:02:26.950750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.934632Z","title":"VALOR : Vision-audio-language omni-perception pretraining model and dataset","venue":null,"work_id":"bf771e3e-4de2-419a-8774-dd47a5a933c6","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.199202Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:864a05e56ababddece2589e9f66a27b07d370623caa1d87ac602268b39d47920","observation_id":"25eba396-9234-4e1d-b685-16c12c5f394d","resolution":{"observed_at":"2026-08-10T00:02:26.938998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.921460Z","title":"Fetv: A benchmark for fine-grained evaluation of open-domain text-to-video generation","venue":null,"work_id":"8029d26c-f532-4947-90e3-b0c6b71180eb","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.202480Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:c4abef87dc5af1889b6d605ee45af4d4b7940cea888fa03dc2bc9ec82f0872e3","observation_id":"d14bee3c-402e-427f-820d-a7e57fb52728","resolution":{"observed_at":"2026-08-10T00:02:26.926543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.900820Z","title":"Mosnet: Deep learning based objective assessment for voice conversion","venue":null,"work_id":"736673ea-8e99-4488-989b-4acffcf57c79","year":2019},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.205464Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:7b31cd27ddcc7fb926915a54bdd9b21a4dddbf6cf1b29a546e12070dbc92affd","observation_id":"4f97cb71-53a0-442b-ae76-0286d41da35d","resolution":{"observed_at":"2026-08-10T00:02:26.908571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.881029Z","title":"Unified-IO 2: Scaling autoregressive multimodal models with vision language audio and action","venue":null,"work_id":"11bbb27c-435d-4605-a0f9-fa9b56b27fea","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.208314Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:f77f7cafbde78d5a0cec2ef3182e4ca5922de483b15b6751da428a0763632460","observation_id":"e32b041a-0311-420d-8a11-f4ef76a4ad8f","resolution":{"observed_at":"2026-08-10T00:02:26.890302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.859711Z","title":"Diff-foley: Synchronized video-to-audio synthesis with latent diffusion models","venue":null,"work_id":"2ee21ec0-f804-4b54-9a43-3006002c3132","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.211651Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:9fd1ea06df195ea6383c8f0f8fd8831dc757e0aa55de660e6c847deb3cb72ca0","observation_id":"9de5644b-981c-4461-9eb9-988615a2d865","resolution":{"observed_at":"2026-08-10T00:02:26.864803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.12285","last_updated":"2022-06-24T13:34:53Z","snapshot_observed_at":"2026-08-13T15:17:29.209423Z","submitted_at":"2022-06-24T13:34:53Z","title":"Speech Quality Assessment through MOS using Non-Matching References","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.12285","snapshot_observed_at":"2026-08-10T00:02:26.215147Z","title":"and Kumar, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.215147Z"},"links":{"cited_paper":"/paper/2206.12285","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:5f6a0e428babd591f6083a2079151637fb9b6e667e32573943a380a7ecd25ee1","observation_id":"781d5118-91c8-4bd0-859c-7de8313a11cf","resolution":{"observed_at":"2026-08-10T00:02:26.215147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.843950Z","title":"C., and Bovik, A","venue":null,"work_id":"7e36aa65-cd1d-4fcb-b726-6e8f34b6cdb5","year":2020},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.218837Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:67d013567e003925098a5dc28ffe4d6891565c5dab9df5c15c84f6bf99444db2","observation_id":"87d68138-c513-4a26-8ed8-011dae96b6dc","resolution":{"observed_at":"2026-08-10T00:02:26.849603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.825351Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality prediction with crowdsourced datasets","venue":null,"work_id":"828f12dd-34cf-4e46-8a48-2ddaf1d420dd","year":2021},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.222182Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:39f3cd9fe985f82e29d8620213f07f4b1d1c41f64b0e1d2f54a3001ad25d62b6","observation_id":"f69d7519-19da-4049-a174-c2f0afd16265","resolution":{"observed_at":"2026-08-10T00:02:26.831081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.810354Z","title":"Audio-visual instance discrimination with cross-modal agreement","venue":null,"work_id":"076fea87-5164-45c2-9684-96ff06497dbe","year":2021},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.226070Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:6f63cad948fe7f934e4513900cde2cb17d4b23dea562febec7bb5ea0eb061e4f","observation_id":"a318e777-902e-41cd-a38b-63a683fa931b","resolution":{"observed_at":"2026-08-10T00:02:26.815819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08601","last_updated":"2025-03-24T04:00:01Z","snapshot_observed_at":"2026-08-12T22:45:43.619281Z","submitted_at":"2024-09-13T07:31:44Z","title":"STA-V2A: Video-to-Audio Generation with Semantic and Temporal Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08601","snapshot_observed_at":"2026-08-10T00:02:26.229598Z","title":"STA-V2A : Video-to-audio generation with semantic and temporal alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.229598Z"},"links":{"cited_paper":"/paper/2409.08601","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:ef7df6265eb81861c75f93d4f50a1d5901a83cf5aa9675153543ff46b1016601","observation_id":"0173fc3d-43ff-461d-8c7a-f56bc89cdaf7","resolution":{"observed_at":"2026-08-10T00:02:26.229598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.793248Z","title":"W., Beerends, J","venue":null,"work_id":"b5ae45e6-fec1-48b8-a0c9-b1e1422b62bd","year":2001},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.233649Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:92064cf4b9ad90957492a1db506497b16556afe3a0470156f865d0697941a47d","observation_id":"76b4a802-6fbc-4208-b57d-19e5ffa2df38","resolution":{"observed_at":"2026-08-10T00:02:26.798275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.778400Z","title":"and Adi, Y","venue":null,"work_id":"dce778e2-b541-407b-83dc-16f950bae311","year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.237491Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:f713aa153927b6fc992472e0e0a8ea9fcd18f260d0a59f45da168f8909bea3ff","observation_id":"b427e816-91cf-41df-910b-1708a806493d","resolution":{"observed_at":"2026-08-10T00:02:26.782611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16355","last_updated":"2023-05-25T04:16:07Z","snapshot_observed_at":"2026-08-02T07:50:35.580500Z","submitted_at":"2023-05-25T04:16:07Z","title":"PandaGPT: One Model To Instruction-Follow Them All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16355","snapshot_observed_at":"2026-08-10T00:02:26.241116Z","title":"PandaGPT : One model to instruction-follow them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.241116Z"},"links":{"cited_paper":"/paper/2305.16355","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:4bb2359948c62cc7b722ee72b20de906ae7df676d23c62aea294efab3835f05e","observation_id":"dcfaa58c-c1fb-4998-ab91-54afefd11800","resolution":{"observed_at":"2026-08-10T00:02:26.241116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.765257Z","title":"The influence of text-guidance on visual attention","venue":null,"work_id":"2ce1799e-bcba-4c4d-83b9-e27c9a6cd743","year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.244867Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:d50c685b64a49e4ee3bb148851af61616d80a29f096d3b2e1b6bdf8d8aa53f59","observation_id":"7d449d2c-7c70-461c-89cd-588cb68bb726","resolution":{"observed_at":"2026-08-10T00:02:26.769698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.749632Z","title":"How is visual attention influenced by text guidance? database and model","venue":null,"work_id":"8cf42ae5-ffb7-4216-bb26-e1b0abb0d8ea","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.248517Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:7da304ff96c29ae8745a5e59b03e10cad3db6300572356c0f3b4c71404bfa024","observation_id":"120815b1-bc21-40e2-bfd9-36e100e1ba76","resolution":{"observed_at":"2026-08-10T00:02:26.754506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09748","last_updated":"2024-09-15T14:38:29Z","snapshot_observed_at":"2026-08-14T02:25:01.988524Z","submitted_at":"2024-09-15T14:38:29Z","title":"Explore the Hallucination on Low-level Perception for MLLMs","version":1},"cited_work":{"arxiv_id":"2409.09748","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.09748","snapshot_observed_at":"2026-08-10T00:02:26.446675Z","title":"Explore the Hallucination on Low-level Perception for MLLMs","venue":"cs.CV","work_id":"d09e4c15-6f32-4cb7-b495-c60eff831717","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.252376Z"},"links":{"cited_paper":"/paper/2409.09748","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:9fa76b08e804cbee7d96cf385f2da42554afd01eec86c4b32274cc1af2c84ce1","observation_id":"8e2c7403-36c5-456d-8351-a3f6fc1535da","resolution":{"observed_at":"2026-08-10T00:02:26.450950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-10T00:02:26.256454Z","title":"I., Burnell, R., Bai, L., Gulati, A., Tanzer, G., Vincent, D., Pan, Z., Wang, S., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.256454Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:19efc525a8a7931fc628ded0b8478a8af8c2a7b848b23a61b3ba3f99a5213bad","observation_id":"acb85e0e-9cfe-4d1f-8f7e-428eaa8e3022","resolution":{"observed_at":"2026-08-10T00:02:26.256454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12387","last_updated":"2024-04-18T17:59:48Z","snapshot_observed_at":"2026-08-13T00:27:11.609683Z","submitted_at":"2024-04-18T17:59:48Z","title":"Reka Core, Flash, and Edge: A Series of Powerful Multimodal Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12387","snapshot_observed_at":"2026-08-10T00:02:26.260452Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.260452Z"},"links":{"cited_paper":"/paper/2404.12387","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:dba2fe27b542f2baff7e9c13b8cc025590d2c3cdb8ef06b4b099eab931fe82bb","observation_id":"aa8832c5-e30d-471c-a17d-7504612c1fe3","resolution":{"observed_at":"2026-08-10T00:02:26.260452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.738016Z","title":"V2a-mapper: A lightweight solution for vision-to-audio generation by connecting foundation models","venue":null,"work_id":"ea395db2-c943-4c67-8d0e-42a5136910ce","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.264346Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:acc61c9c4954ce33c82e195bd875c03cb4c95c789e015930eb09668f48272f8c","observation_id":"af93185d-f391-436d-bdd6-ecd0f6fea59f","resolution":{"observed_at":"2026-08-10T00:02:26.741748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07346","last_updated":"2025-02-02T08:58:09Z","snapshot_observed_at":"2026-08-14T03:29:28.390555Z","submitted_at":"2024-05-12T17:45:11Z","title":"Quality Assessment for AI Generated Images with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07346","snapshot_observed_at":"2026-08-10T00:02:26.267826Z","title":"Understanding and evaluating human preferences for ai generated images with instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.267826Z"},"links":{"cited_paper":"/paper/2405.07346","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:37ac73f456b6f1fe71a7b876217d8a5ef170882cd713a10a192d6e958f7db0f9","observation_id":"a06682c8-17b6-480a-b6c1-0b2897661010","resolution":{"observed_at":"2026-08-10T00:02:26.267826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17221","last_updated":"2024-11-26T08:43:15Z","snapshot_observed_at":"2026-08-13T04:44:35.550453Z","submitted_at":"2024-11-26T08:43:15Z","title":"AIGV-Assessor: Benchmarking and Evaluating the Perceptual Quality of Text-to-Video Generation with LMM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17221","snapshot_observed_at":"2026-08-10T00:02:26.271791Z","title":"AIGV-Assessor : Benchmarking and evaluating the perceptual quality of text-to-video generation with lmm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.271791Z"},"links":{"cited_paper":"/paper/2411.17221","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:bd086531c8ed399341bac395cd71f44dd8633cf9cf441b563a353f757d3c0e04","observation_id":"cebbe6fc-9da6-49a0-a4a0-2a4688c00092","resolution":{"observed_at":"2026-08-10T00:02:26.271791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.725566Z","title":"Tiva: Time-aligned video-to-audio generation","venue":null,"work_id":"daba42e9-abcd-4341-ac68-ecd956bbc58a","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.275625Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:a53d6987f891489fe89360f08a5b30f7a652b0740d8ddeed1c638f364d7c9a9c","observation_id":"0a76a232-dce4-41ed-abc9-687eea36cec2","resolution":{"observed_at":"2026-08-10T00:02:26.729335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.710955Z","title":"A recipe for scaling up text-to-video generation with text-free videos","venue":null,"work_id":"d9f73b9b-3eea-4879-9534-b51b42d084e9","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.279119Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:d228a5c30ada10068ff4745ea39487752b1723262b78a604de993cfce4f3c049","observation_id":"2fb4dc11-4839-43de-bd19-a2a57c1a7e7a","resolution":{"observed_at":"2026-08-10T00:02:26.714931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.697504Z","title":"Modaverse: Efficiently transforming modalities with llms","venue":null,"work_id":"3a6bda59-0e98-4f52-878c-e331509c9b4c","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.282662Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:5589ce703527d77c7af6fd9ec8da2a2eb997093d1229b30820b3cba5ed87c609","observation_id":"018796f9-3fd2-43e6-b295-73f652f6c019","resolution":{"observed_at":"2026-08-10T00:02:26.703112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-08-13T10:04:30.993324Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-10T00:02:26.286357Z","title":"LAVIE : High-quality video generation with cascaded latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.286357Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:fbcc3d2c561609549d350672f2a148d3ad47101193f2ad641cbedb9d3b128806","observation_id":"4e73897b-2810-45a3-94e7-3160415148e0","resolution":{"observed_at":"2026-08-10T00:02:26.286357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00320","last_updated":"2025-01-04T18:12:07Z","snapshot_observed_at":"2026-08-12T23:52:40.690851Z","submitted_at":"2024-06-01T06:40:22Z","title":"Frieren: Efficient Video-to-Audio Generation Network with Rectified Flow Matching","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00320","snapshot_observed_at":"2026-08-10T00:02:26.290373Z","title":"Frieren: Efficient video-to-audio generation with rectified flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.290373Z"},"links":{"cited_paper":"/paper/2406.00320","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:b2eacd7fe4983641261a26c9b5e3eb9f24eea4cdd8357d3e74fdd8d2c6ff67dd","observation_id":"3a242a52-48b2-4cec-9a7b-8c4e1b088951","resolution":{"observed_at":"2026-08-10T00:02:26.290373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.684785Z","title":"Q-Align : Teaching LMMs for visual scoring via discrete text-defined levels","venue":null,"work_id":"8651dcc4-0c5b-4024-be45-c00abe39eee1","year":null},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.293796Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:89e559fd7251b5bd222610671a3a2b01158c48d32d0e3098296f3518a3eaa54b","observation_id":"11e0a367-81ea-43cb-9175-79584784ff06","resolution":{"observed_at":"2026-08-10T00:02:26.689470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.670917Z","title":"NExT-GPT : Any-to-any multimodal llm","venue":null,"work_id":"d59b73b2-f2e3-4edc-ac42-b8e006b2d4d0","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.297158Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:1f5574a6cb240ee63a6d6f07a9733b0ba7ea3d0392405debdc0e76296f0d58aa","observation_id":"f2864ae5-a3c3-4d5d-806b-0b7be6a7b944","resolution":{"observed_at":"2026-08-10T00:02:26.675299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.656323Z","title":"Sonicvisionlm: Playing sound with vision language models","venue":null,"work_id":"d7bab440-e0c4-42e5-ab62-f6c3eeb4120a","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.300422Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:bd3c9babf92f764730fba7c984bf8843d42ab5080c4c1432c8519c2a567f2841","observation_id":"50d2b6f4-94a9-42b8-a00c-386de598363e","resolution":{"observed_at":"2026-08-10T00:02:26.661344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09823","last_updated":"2024-09-15T18:51:18Z","snapshot_observed_at":"2026-08-12T22:44:32.885142Z","submitted_at":"2024-09-15T18:51:18Z","title":"Efficient Video to Audio Mapper with Visual Scene Detection","version":1},"cited_work":{"arxiv_id":"2409.09823","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.09823","snapshot_observed_at":"2026-08-10T00:02:26.365346Z","title":"Efficient Video to Audio Mapper with Visual Scene Detection","venue":"cs.SD","work_id":"3632ef4d-5881-49eb-a119-4d46871a03ef","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.303436Z"},"links":{"cited_paper":"/paper/2409.09823","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:d72a029992a561b973cdf93d212c86ba1e1a2d86a9c39378a2c4358057efe2a4","observation_id":"910fe5ed-f1b0-48c2-8584-ca20a38da188","resolution":{"observed_at":"2026-08-10T00:02:26.371834Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.640418Z","title":"Telepresence video quality assessment","venue":null,"work_id":"f73ff1ab-838a-43cc-9ea2-991f4dd84efa","year":2022},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.306497Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:7787b61d944fc3ca42bb7e73fe576385762418492bf9fe30891d9914a8e43112","observation_id":"795ccb3c-3b8b-435e-840b-12bb25dca64c","resolution":{"observed_at":"2026-08-10T00:02:26.644619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.628568Z","title":"E., Fu, S.-W., Fuh, C.-S., Tsao, Y., and Wang, H.-M","venue":null,"work_id":"bb708781-5402-4629-b0a6-1e3d76343064","year":2020},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.309233Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:66f37f2fd005ad7c885e702c07bff9da15a674e152fb4c4e4487d8b251709cf7","observation_id":"22a6b40c-e1a5-4ea8-8e30-a5d03663809d","resolution":{"observed_at":"2026-08-10T00:02:26.632511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01494","last_updated":"2024-07-01T17:35:56Z","snapshot_observed_at":"2026-08-12T23:31:04.494652Z","submitted_at":"2024-07-01T17:35:56Z","title":"FoleyCrafter: Bring Silent Videos to Life with Lifelike and Synchronized Sounds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01494","snapshot_observed_at":"2026-08-10T00:02:26.312439Z","title":"Foleycrafter: Bring silent videos to life with lifelike and synchronized sounds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.312439Z"},"links":{"cited_paper":"/paper/2407.01494","citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:18dd5b1247e356e6cbdd609adaa3c0234d292fc0452ba1f68b5b1173399eb57e","observation_id":"24cb6520-edae-4e6e-ab85-24c89b42df46","resolution":{"observed_at":"2026-08-10T00:02:26.312439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.616371Z","title":"Lmm-pcqa: Assisting point cloud quality assessment with lmm","venue":null,"work_id":"03667d2f-d29d-4582-979d-fb5fa4c89f17","year":2024},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.316126Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:3b056f49cee6358931fbe277cae2d5490dc2b59f881d974c4e809ac7aa7b1cdb","observation_id":"0e247d60-34a4-48fc-93ba-a0493d534c6d","resolution":{"observed_at":"2026-08-10T00:02:26.620940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T00:02:26.319596Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-10T00:02:26.319596Z"},"links":{"citing_paper":"/paper/2501.18314"},"observation_digest":"sha256:ba0122d79ab19a36428065fcf0038fd33ace9e2fc418305cd637051ce2581fe1","observation_id":"07557746-ac0d-4d5e-b0b6-243fc6bfc735","resolution":{"observed_at":"2026-08-10T00:02:26.319596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.18314","last_updated":"2025-07-14T07:08:07Z","latest_version":2,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-14T07:26:04.635905Z","submitted_at":"2025-01-30T12:43:47Z","title":"AGAV-Rater: Adapting Large Multimodal Model for AI-Generated Audio-Visual Quality Assessment"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":2,"verified_fuzzy":43},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 2 inbound Pith citation observations for arXiv:2501.18314."}