{"as_of":"2026-08-07T06:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:53ec6cc8880704dee3ee6c1561f07ae20128b9d1d887300de5469857f10081a4","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:06:15.946132Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.06523/citation-record","integrity":"/paper/2507.06523/integrity","json":"/paper/2507.06523/citation-record.json","paper":"/paper/2507.06523"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.687113Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.687113Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:bd51b44c1b43b14912c2dc05685695b3dec1b84d71736e02f1e0b47730f05a43","observation_id":"5f283fee-f754-4199-a520-2ad4785a941d","resolution":{"observed_at":"2026-08-06T19:06:15.687113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.693631Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.693631Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:2e9886e372143e63a4772ef844df0e5acc2e2f5abcdac4dcfedfdaaadc1f490a","observation_id":"7f550a32-eddc-4064-abf9-8368032a0864","resolution":{"observed_at":"2026-08-06T19:06:15.693631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T19:06:15.699508Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.699508Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:53790e32bdf7401e3b2a709bb868c5fd095894afa0f09a2fe5dabd516a23f844","observation_id":"bbe0cab4-82e0-4d31-9368-22ff14061d92","resolution":{"observed_at":"2026-08-06T19:06:15.699508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:18.671268Z","title":null,"venue":null,"work_id":"838054cd-dc73-4e80-b1e2-0eccd6205744","year":2005},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.705426Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:a3abc9cfd0afc378a12db1e55715baf0dfdf3d245524563f0668a30100279224","observation_id":"e681670b-b311-404e-aeab-21af7942e34e","resolution":{"observed_at":"2026-08-06T19:06:18.766097Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:18.484513Z","title":null,"venue":null,"work_id":"eac83aed-6f9a-44c2-9340-961c7b506bf1","year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.712089Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:312134b500f404efe11c6513b09cd05497bc1c26717d24eb10c920d4c209aa05","observation_id":"21d70a30-6f0c-461e-a05b-69ca07295eaa","resolution":{"observed_at":"2026-08-06T19:06:18.592460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T19:06:15.723799Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.723799Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:ea43819ba6b104bbd32428a4252b66bb449566534eaea715c2bf2936e272654d","observation_id":"c75fc183-2605-4fd2-80c6-06dd9e14f443","resolution":{"observed_at":"2026-08-06T19:06:15.723799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:18.304100Z","title":"Baldridge, Roopal Garg, Peter Anderson, Ranjay Krishna, Mohit Bansal, Jordi Pont - Tuset, and Su Wang","venue":null,"work_id":"211bb3a9-1d38-41df-90d1-47059ecbbe51","year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.729401Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:c964900dd76d8e17b0224b7c8ad856c18473db83f708e736e5263a7fc9cec0c1","observation_id":"9a317bad-2679-438f-9944-0b3fa063ef81","resolution":{"observed_at":"2026-08-06T19:06:18.373698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:18.132142Z","title":null,"venue":null,"work_id":"f0f5addf-fc2e-4a37-bc78-f9ea67ca9d9e","year":2021},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.735407Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:788d6dfb1652b26a9d37250f9a4e90839325d9e3c0a6740940459ef27591f542","observation_id":"5d9ac1fa-447b-4096-9d55-bb7f4b6b80f5","resolution":{"observed_at":"2026-08-06T19:06:18.195171Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:17.977733Z","title":"Gritsenko, William Chan, Mohammad Norouzi, and David J","venue":null,"work_id":"3f73d927-3903-4ab2-8a68-80a215f634dd","year":2022},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.740511Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:837cf68c231f0621aac583ca94e22771e2a77f2588a2c5eb1ab575754d6059e5","observation_id":"6b04b152-ebe2-4c62-8d8c-bd54f382a8ca","resolution":{"observed_at":"2026-08-06T19:06:18.029151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.745427Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.745427Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:48b852920c6e9d8cc626000c0a7ca1c34939849045bcf81941299e66b0e6060f","observation_id":"26821cb2-1457-4b6f-b88e-b31ba2ea080a","resolution":{"observed_at":"2026-08-06T19:06:15.745427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-06T19:06:15.750213Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.750213Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:2e0fefe3ae2dd960c3f6694c1daa1da985ed66a2ecaf7e5cb91833cb5d61c82c","observation_id":"3d165508-a40a-4d30-8a19-eb5abef2d1ba","resolution":{"observed_at":"2026-08-06T19:06:15.750213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:17.800314Z","title":null,"venue":null,"work_id":"11adf8b9-68e1-400c-b862-0381cbedad7d","year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.755347Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:1a0ae70eabe49311207fc13da02581b03af2ff65b4520bb37c92420c602f26a8","observation_id":"66c6bf8d-ac84-43b9-9ba5-eb7aa8674f7d","resolution":{"observed_at":"2026-08-06T19:06:17.886643Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-06T19:06:15.760357Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.760357Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:ea7a59206bf8922dd34c182495243e1c6b48080cb28808b9c2cb99ba189eb7e4","observation_id":"65a6c944-d0cf-4eb8-bf74-521ac92acee3","resolution":{"observed_at":"2026-08-06T19:06:15.760357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.765679Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.765679Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:f4ff684087efed845c70f6897db5a4437561a82c2ef9127fb58d37bb4b27ab8b","observation_id":"1479f4e8-f67c-41d8-a65d-a0a6b06a3999","resolution":{"observed_at":"2026-08-06T19:06:15.765679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03735","last_updated":"2025-03-31T21:07:49Z","snapshot_observed_at":"2026-07-06T20:01:50.356653Z","submitted_at":"2024-12-04T22:03:19Z","title":"VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03735","snapshot_observed_at":"2026-08-06T19:06:15.770693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.770693Z"},"links":{"cited_paper":"/paper/2412.03735","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:e60d6fe224910fa52487a1a2a6025a274388bed5959b4afc0d41ef78048f1edb","observation_id":"ee748921-e4ec-4a1b-a389-d47b6ebf81e7","resolution":{"observed_at":"2026-08-06T19:06:15.770693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.775620Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.775620Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:eda1db1a5e7d85b822cb7cc56739c171144a4c20691d5d7abcca3ca3a883f265","observation_id":"2740a068-c28d-4c68-81f5-3458d651095b","resolution":{"observed_at":"2026-08-06T19:06:15.775620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.780126Z","title":null,"venue":null,"work_id":null,"year":1932},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.780126Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:b5baa64ee525e94468c693145f6d0bd1187be8fecb9b894dabf0361a0ff94ca4","observation_id":"a65af57c-b4f7-4f2f-9afa-3dfe8daa132c","resolution":{"observed_at":"2026-08-06T19:06:15.780126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:17.617830Z","title":null,"venue":null,"work_id":"ef504c3c-3747-464f-af14-c6109d259d13","year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.785299Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:06a5ee2248404fe1cb74d9e5bfacf038e6152219cc1f7feacb4cbc65475f478b","observation_id":"96df4318-1a0b-4fac-baf5-fde92d9f40b7","resolution":{"observed_at":"2026-08-06T19:06:17.681986Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:17.396221Z","title":null,"venue":null,"work_id":"b7e43bbc-4e6d-48c0-ac08-648dc681f195","year":2004},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.790896Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:28ecfa185ead19ad8a19759c4fa6f66c9783ecb07a6897348eb0aaa052e1f9ce","observation_id":"7285bf6d-1e50-4717-924d-f74ea5189131","resolution":{"observed_at":"2026-08-06T19:06:17.502128Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:17.206999Z","title":null,"venue":null,"work_id":"3a48b4bd-c509-4121-bfa4-ef59f71f6a25","year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.796564Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:8dda13a6efe360cc2781ee2d414c66b8d32ff61fce33237f9de4bc3e025a1037","observation_id":"94ccacb3-d28b-43ba-b541-ed235b18fa4d","resolution":{"observed_at":"2026-08-06T19:06:17.311372Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-06T19:06:15.801334Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.801334Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:40876ed60851037150d9e785c5569ce0014aa1073098a386b4af741a1385ca04","observation_id":"bc9d5d64-ceae-413a-9f0d-684b13d764c2","resolution":{"observed_at":"2026-08-06T19:06:15.801334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.817135Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.817135Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:4a212e5bc000f2a3f0c773ece50e0cc59b8a19fbb75afefafb7bac43d8f2c7fc","observation_id":"fc8183c3-8b17-4b11-8bc2-f5f4cdcaba21","resolution":{"observed_at":"2026-08-06T19:06:15.817135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.822295Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.822295Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:9d947236ee6630acd0a30e7d0bbbb9f6d08cb160607efa87c696fccc48156b7f","observation_id":"535a9d56-8216-4fe6-a09d-9266375f57f1","resolution":{"observed_at":"2026-08-06T19:06:15.822295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.829043Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.829043Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:16055830b87a10eab2d22396ca64aa3a67aad31cf04a5823aee0723014119d9a","observation_id":"5e193454-6832-4546-90af-830c051f850c","resolution":{"observed_at":"2026-08-06T19:06:15.829043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.834552Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.834552Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:c5ddcb88c4ab1f5ecd74250216fdfc916e6ee818729192da80856da902640a24","observation_id":"ab604c38-9130-47f2-bae6-b8e8a484fd59","resolution":{"observed_at":"2026-08-06T19:06:15.834552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:17.032648Z","title":null,"venue":null,"work_id":"8cc67c04-7f4b-4e53-99bd-c20fb2854851","year":2002},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.839954Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:3e6d3eac598b2bc0a36b15a04df5f9a35a9705049ff4d66a14da22b94fbdb49b","observation_id":"a777011d-2222-43bf-9b00-9ef36e32997a","resolution":{"observed_at":"2026-08-06T19:06:17.097973Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10867","last_updated":"2025-03-19T18:53:09Z","snapshot_observed_at":"2026-08-02T22:09:23.477801Z","submitted_at":"2024-11-16T19:23:12Z","title":"ViBe: A Text-to-Video Benchmark for Evaluating Hallucination in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10867","snapshot_observed_at":"2026-08-06T19:06:15.846144Z","title":"Sheth, and Amitava Das","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.846144Z"},"links":{"cited_paper":"/paper/2411.10867","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:e0a321b50a9bff57b5c99fcc69bb98af100586ff99c91540241aeff1c14e2662","observation_id":"0820b5a3-e805-40ee-adce-0c285e84c68a","resolution":{"observed_at":"2026-08-06T19:06:15.846144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-26316-3","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:16.251022Z","title":null,"venue":null,"work_id":"d19a0455-b416-4115-aed7-fa65b3403ac1","year":2022},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.852275Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:20492bcd6d72c6a5daa4fab2220e5873529e60a0efafdcc2a0bd829c34b211a0","observation_id":"a190fcd7-d05e-4ad8-a3d6-ff8aecbbda21","resolution":{"observed_at":"2026-08-06T19:06:16.257639Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:16.869273Z","title":null,"venue":null,"work_id":"090a0345-d51a-45c2-a6fe-1ccd3bb3414d","year":2017},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.857300Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:181d6e28f727f4da363eb1fa70dae5a28751b0504bece5ddbaaa5fc01e18bd4f","observation_id":"09911d56-2b23-4201-869b-d3e0edd0fb07","resolution":{"observed_at":"2026-08-06T19:06:16.947263Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-06T19:06:15.862734Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.862734Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:66c6b21a3209b731d29a5c766fc1580956ddf349608185489e1db3624e161a46","observation_id":"5e6c18e7-049b-4473-88b9-8a2bce9c2907","resolution":{"observed_at":"2026-08-06T19:06:15.862734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:16.740870Z","title":null,"venue":null,"work_id":"2a7e6611-ca66-4668-ac44-4735fc02a59b","year":2023},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.867653Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:342b0a59a75715c8cb12683d7c9767c3b4efa9a79583e2acddf76497f7dcc195","observation_id":"b474734e-525e-4d31-975a-47f6502592ce","resolution":{"observed_at":"2026-08-06T19:06:16.785779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16338","last_updated":"2024-06-24T06:21:59Z","snapshot_observed_at":"2026-08-06T20:31:18.439488Z","submitted_at":"2024-06-24T06:21:59Z","title":"VideoHallucer: Evaluating Intrinsic and Extrinsic Hallucinations in Large Video-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16338","snapshot_observed_at":"2026-08-06T19:06:15.872778Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.872778Z"},"links":{"cited_paper":"/paper/2406.16338","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:34e138b65d1f40fc569da64ca2169ff838505baf1585f52f693c6befc2596e67","observation_id":"ec42d65f-0f14-4190-a446-33c46f45a37f","resolution":{"observed_at":"2026-08-06T19:06:15.872778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.877967Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.877967Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:2093383cf0d058c27715f64d91275ccf44db3bf4141b137ef2d5e2e7e302e547","observation_id":"4a56766d-dc34-4a74-a1df-32c162be0325","resolution":{"observed_at":"2026-08-06T19:06:15.877967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.884147Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.884147Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:21e9546d319138ed1ad2bca658e6cd15eb43522e50c69443255f59a65398d4ff","observation_id":"94fa8b39-cfaf-4acc-91d7-8e80b70f8259","resolution":{"observed_at":"2026-08-06T19:06:15.884147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-07-06T17:15:42.343063Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-08-06T19:06:15.889647Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.889647Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:73ae716d4993ce71234d2e3d7694b5e818c3cd29784528ce73db1a88269bc0d1","observation_id":"d94fbeeb-4f90-4105-8084-6e11203b2c68","resolution":{"observed_at":"2026-08-06T19:06:15.889647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.894820Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.894820Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:12f1cc92c286464e04afe2564a1f8fefdbc54379fb4ef8ea1e19422477607f42","observation_id":"c6abdaa6-460c-499c-b7ca-a61acda16651","resolution":{"observed_at":"2026-08-06T19:06:15.894820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-06T19:06:15.900108Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.900108Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:3eec34239bf01d574ac2f2c2e76416d24384c7001e28fa02563a5592a37b10c7","observation_id":"fcd7c5f7-9d02-49eb-9039-f9e1fb35a32e","resolution":{"observed_at":"2026-08-06T19:06:15.900108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T19:06:15.905122Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.905122Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:9952c4dd995db111c18dcc2039507751ccbdbef911cbab89fd5f0949cde8eb15","observation_id":"b1647176-3413-4f66-a35e-eaf65c5ce11d","resolution":{"observed_at":"2026-08-06T19:06:15.905122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.910668Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.910668Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:11a89ba8ba2c303c5ae7025f47a7eed224a8b988bc1f94339348cbfcca85d89a","observation_id":"cb86b4e1-86ce-410b-9966-44437c9a19a8","resolution":{"observed_at":"2026-08-06T19:06:15.910668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.916208Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.916208Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:a4ee81d99a7f17e5c888769db039c16565581df2c091809826988c5e0dff1325","observation_id":"808e5899-ebd7-45e9-a295-ebc0cf4cdfc4","resolution":{"observed_at":"2026-08-06T19:06:15.916208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-06T19:06:15.921090Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.921090Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:4ac51dea401f5c4c8eaca3dc5ed7265c2c068e0a8be4e14c5344cb8c85ac03e6","observation_id":"77fc295d-56e6-4f3d-9f43-01fd93e6e70a","resolution":{"observed_at":"2026-08-06T19:06:15.921090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.926034Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.926034Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:a9a59f6532259ec583e714743fd662bc6319a11b4f152c9a73f54b954704ae51","observation_id":"0bdb533e-5eac-4116-9315-aa8c855dff17","resolution":{"observed_at":"2026-08-06T19:06:15.926034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.930986Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.930986Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:a37180a59fefc154fb4dc4946af0a6734db7ca1f1067bfc6c4cee7fa8d8669bd","observation_id":"23f97203-057b-4b1f-875d-47c2b66a2ba4","resolution":{"observed_at":"2026-08-06T19:06:15.930986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:06:15.935424Z","title":"Weinberger, and Yoav Artzi","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.935424Z"},"links":{"citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:1b1cf71f779ea7f62464051f2276327ff3c434644f838ceca8c34b16fd56b161","observation_id":"90f60c04-8e70-4ec3-907d-3e5688c3aaf6","resolution":{"observed_at":"2026-08-06T19:06:15.935424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-06T19:06:15.941028Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.941028Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:a591860d0436f1e313d7ef469d7a221bb05a5653bac31bc7316d9215c814fbf0","observation_id":"2270874a-7514-4557-879f-293e7e4052f8","resolution":{"observed_at":"2026-08-06T19:06:15.941028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-06T19:06:15.946132Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T19:06:15.946132Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2507.06523"},"observation_digest":"sha256:d8a4c118dddbead541546d82a416fc6ec2334086719820ac709e41f55cfd546a","observation_id":"13e90a31-a301-4b87-b071-eadd88c43079","resolution":{"observed_at":"2026-08-06T19:06:15.946132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.06523","last_updated":"2025-07-09T03:51:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T04:03:28.720884Z","submitted_at":"2025-07-09T03:51:27Z","title":"FIFA: Unified Faithfulness Evaluation Framework for Text-to-Video and Video-to-Text Generation"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2507.06523."}