{"as_of":"2026-08-13T08:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f3cd78a973c11910c4f5fc3780ecbeebae2c55edc1b261427937814a7aa7504","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:26:22.185125Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.16718/citation-record","integrity":"/paper/2411.16718/integrity","json":"/paper/2411.16718/citation-record.json","paper":"/paper/2411.16718"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T14:26:21.840317Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.840317Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:7e43ed431f4fc5648e6f0910342deb3b85631c429a0d115d1a4cab0b6c996e44","observation_id":"2012c825-aedf-489b-ac78-0f628535be39","resolution":{"observed_at":"2026-08-12T14:26:21.840317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.418489Z","title":"Llama 3.2: Revolutionizing edge ai and vision with open, customizable models","venue":null,"work_id":"e223c1d8-5ca1-4c69-93d4-112440a80637","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.846209Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:f132e19a852093805b3369aa59a1951633e3d83ea1dfb3d2e813871ddb07c17f","observation_id":"e40035c4-23c2-4057-a9d7-4fc2f9cda136","resolution":{"observed_at":"2026-08-12T14:26:23.424276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.403406Z","title":"Principles of Model Checking","venue":null,"work_id":"be7bba6c-e7e5-4ce8-ae9c-b9d57bc0b2e9","year":2008},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.851321Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:e9b8ceb9f12c60c58b8931cb3779751b50aa0fd6077f4ba6eb8a33538c3042b7","observation_id":"964aef64-e29a-4662-8678-1704332f6d35","resolution":{"observed_at":"2026-08-12T14:26:23.408131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:21.856160Z","title":"Align your latents: High-resolution video synthesis with la- tent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.856160Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:541e55aae0ba22d7219dfcf9c509b8b721c8201080bd0b3a7abf7a7136ad42e7","observation_id":"e5ad5ca7-8e41-4990-b1c6-0164cd217775","resolution":{"observed_at":"2026-08-12T14:26:21.856160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.377872Z","title":"Synthesis of LTL Formulas from Natural Language Texts: State of the Art and Research Directions","venue":null,"work_id":"ec3674ee-2b39-47a7-afc3-9b924ccb9a08","year":2019},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.860847Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:8a83f4a416c69dd6535fab4a0db57da0a13ddeb5bf84ef212ddf7dc75f1f7499","observation_id":"23cf971d-dffd-4190-8e34-376f11f239f6","resolution":{"observed_at":"2026-08-12T14:26:23.383281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.346592Z","title":"Storybench: A multifaceted benchmark for continuous story visualization, 2023","venue":null,"work_id":"8503de9a-4db0-4be2-bed8-6ac530bc0f3b","year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.870301Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:c84a526f902c7d01dbefbe9a0ea6ebdcecdf5c6b3615b68f1adef4f37a8c22e7","observation_id":"b72d4162-44bd-444d-b53f-5b945079acab","resolution":{"observed_at":"2026-08-12T14:26:23.351588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-12T14:26:21.875007Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.875007Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:259f2b33e4dc9e0d05882f8698c0da3790d980822cc839299ddbeee1700fc257","observation_id":"d94f6ee4-7cfc-4c7c-9d70-5ddd02f89d3e","resolution":{"observed_at":"2026-08-12T14:26:21.875007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.332121Z","title":"Nl2tl: Transforming natural languages to temporal log- ics using large language models, 2024","venue":null,"work_id":"011f6871-a19c-4166-b809-8075bc3ba67e","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.879891Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:28d52e14546c56aa039269fc683d0a6bcd0278dc38b339c43ed9f79e1bb8bffa","observation_id":"10a2d920-50de-468b-9b90-14dc47075204","resolution":{"observed_at":"2026-08-12T14:26:23.336966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08009","last_updated":"2023-09-14T19:35:53Z","snapshot_observed_at":"2026-08-12T03:04:21.354901Z","submitted_at":"2023-09-14T19:35:53Z","title":"Measuring the Quality of Text-to-Video Model Outputs: Metrics and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08009","snapshot_observed_at":"2026-08-12T14:26:21.884353Z","title":"Measuring the quality of text-to-video model out- puts: Metrics and dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.884353Z"},"links":{"cited_paper":"/paper/2309.08009","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:824212a32f2a7913466f51a52daddfe59bd5321dcf765d39bb15950b1d89e539","observation_id":"51f155c3-3c35-45f9-a22a-44d4299e0997","resolution":{"observed_at":"2026-08-12T14:26:21.884353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.316761Z","title":"Towards neuro- symbolic video understanding","venue":null,"work_id":"b2b577db-ee38-46c2-bb8d-26d4815e51da","year":2025},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.889305Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:fa0c1e1a310fedeb039f50c5defed9179bd3fc719d5d8495bba4418645408547","observation_id":"77a0696e-5338-491b-a46c-c10a4250b74b","resolution":{"observed_at":"2026-08-12T14:26:23.321679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04180","last_updated":"2024-05-07T10:39:14Z","snapshot_observed_at":"2026-08-13T00:13:15.734303Z","submitted_at":"2024-05-07T10:39:14Z","title":"Sora Detector: A Unified Hallucination Detection for Large Text-to-Video Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04180","snapshot_observed_at":"2026-08-12T14:26:21.893694Z","title":"Sora detector: A unified hallucination detection for large text-to-video models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.893694Z"},"links":{"cited_paper":"/paper/2405.04180","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:ef4c0d3fb03bf6894541b967394380763b4289c2230622e6ce8d1c83a7337a86","observation_id":"5558303e-58d1-48f1-b6a6-15dd5d2fafff","resolution":{"observed_at":"2026-08-12T14:26:21.893694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.300109Z","title":"Clarke, Orna Grumberg, and Doron A","venue":null,"work_id":"2dddc82f-30f6-49f0-ba71-7081715f00c9","year":1999},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.898716Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:6de38ba15e86eea51b99a1f0c98665e817b36341f473cdbfda8c9ff6afcf7437","observation_id":"8a9954c8-2d77-47bc-aaf7-649240347a71","resolution":{"observed_at":"2026-08-12T14:26:23.306128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.284846Z","title":"Allen Emerson","venue":null,"work_id":"bab35b30-a4c1-4389-906e-bd6971f9ff17","year":1991},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.902923Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:bc6ed206c25b05a4a8d3d4dd5c3b5ca724d6444b181b67416eff501efe3c26bc","observation_id":"08ea9a92-4ca8-4e71-8425-78735c7a8242","resolution":{"observed_at":"2026-08-12T14:26:23.289731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:21.907665Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.907665Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:066fe32a9675515ba452815ce89e78e822cdd6f99380f615c13c1231e35202c2","observation_id":"fe51edc2-47a4-44ed-9664-c86e5b3728bb","resolution":{"observed_at":"2026-08-12T14:26:21.907665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.259689Z","title":"Pytorchvideo: A deep learning li- brary for video understanding","venue":null,"work_id":"6d70eec9-c815-4bb7-9e09-58cf272a4244","year":2021},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.912293Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:1760b3684f93b19f6cd0e1132dc37a7fb14013fa945773f2e232f0422e31f429","observation_id":"73f59b18-2fb3-434c-a8a2-29ec999419c5","resolution":{"observed_at":"2026-08-12T14:26:23.264254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-12T23:44:07.499654Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-12T14:26:21.916622Z","title":"Tc-bench: Benchmark- ing temporal compositionality in text-to-video and image-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.916622Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:43616d71c865ee1628c11108064148fb71656bfaa3dad02bc6b44dad3b9903a3","observation_id":"281c7401-6ffb-457a-b9d7-48afa78b3874","resolution":{"observed_at":"2026-08-12T14:26:21.916622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.243576Z","title":"Nl2ltl – a python package for converting natural language (nl) instruc- tions to linear temporal logic (ltl) formulas","venue":null,"work_id":"33840378-2408-42aa-beb1-d6c1c9cc983a","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.921254Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:450618b5c250a58f06949d5cc24b774ca5ff8c1c8691c0d6f19c6b3a553ae8d1","observation_id":"2507997f-e589-431d-b227-3b0d89e3ab26","resolution":{"observed_at":"2026-08-12T14:26:23.249571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.228875Z","title":"Videoscore: Building auto- matic metrics to simulate fine-grained human feedback for video generation, 2024","venue":null,"work_id":"5501d29e-f216-4ee1-b033-6444ec746aaf","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.925775Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:0900b4239e42297177b13dce1af6f3c68e17e3f23b17f41ec83a335f8981b76a","observation_id":"9b728dc2-e6bb-418e-bd17-64e86c720cbd","resolution":{"observed_at":"2026-08-12T14:26:23.233599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.07080","last_updated":"2020-10-06T19:43:24Z","snapshot_observed_at":"2026-08-10T20:46:27.164358Z","submitted_at":"2020-02-17T17:19:40Z","title":"The Probabilistic Model Checker Storm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.07080","snapshot_observed_at":"2026-08-12T14:26:21.930057Z","title":"The probabilistic model checker storm","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.930057Z"},"links":{"cited_paper":"/paper/2002.07080","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:cf245a5e540c2bc50fd660e7a92ace885aacee1791ce95b1e33ccc642b60f0f2","observation_id":"13d02dc8-5f20-4edd-af67-1f5cecbf94b9","resolution":{"observed_at":"2026-08-12T14:26:21.930057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:21.934999Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.934999Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:1f2cacdebd5de2ec0d9196732cb1590e06df17ba3f1b0af1ce2f3592fbdce59d","observation_id":"93b46110-81d0-43bf-96c1-eb831e269877","resolution":{"observed_at":"2026-08-12T14:26:21.934999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.204466Z","title":"Make it move: Controllable image-to-video generation with text descrip- tions, 2022","venue":null,"work_id":"0657b130-65bb-486d-8f0e-f9a122d0c447","year":2022},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.939410Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:33e0e5793f1ee6daf63e6aa01970809517ef0e2215591f45cf8d26a7f03c5264","observation_id":"6a97a529-eda6-4b44-9424-aec28eb66a84","resolution":{"observed_at":"2026-08-12T14:26:23.209310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.189229Z","title":"T2i-compbench: A comprehensive bench- mark for open-world compositional text-to-image genera- tion","venue":null,"work_id":"29e7fc4a-fce4-4ad4-bbbe-747438f418cb","year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.943705Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:938445167fe803648485ca4043a2709a3c82e758f042e45b1e187a52980bc98e","observation_id":"548969c0-6e22-434e-8eb1-b76015f588da","resolution":{"observed_at":"2026-08-12T14:26:23.194025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:21.947981Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.947981Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:0a32959cfd1f00822be6dd24842b44dbd5cfc928fa0fc6d37cc6e75cabb8a622","observation_id":"9bf8b5e0-75b9-48a5-8ee2-c5c9b9223871","resolution":{"observed_at":"2026-08-12T14:26:21.947981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.164655Z","title":"Logic in Computer Science: Modelling and Reasoning about Systems","venue":null,"work_id":"b84946c2-dfd1-42b4-b8f6-234239e75530","year":2004},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.952180Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:7a85ec20602ef3ffdd6dc38bd347aa34149322c53d309f6c5b84abaefcfd0800","observation_id":"a6e60b85-d3fa-4b24-a418-fcc645c65939","resolution":{"observed_at":"2026-08-12T14:26:23.169428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.150411Z","title":"Peekaboo: Interactive video generation via masked- diffusion, 2024","venue":null,"work_id":"bcd16441-300f-4a10-91f3-aea34c94c9aa","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.956444Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:8563715a515d5cab2369d300780e5837f29c3a3d971a345370285727542fd899","observation_id":"722f48ea-01b1-47b6-be50-336cbe588147","resolution":{"observed_at":"2026-08-12T14:26:23.155080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.135783Z","title":"T2vbench: Benchmarking temporal dynamics for text-to- video generation","venue":null,"work_id":"ce451c7c-1087-4cfd-baa4-bb50055d3c9e","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.960900Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:0c78cb0ca9614b3faa8227591f646abca240133ae7ef672ff6adef1260763186","observation_id":"e8202b47-3b36-48cc-b4ae-7a7da1db6785","resolution":{"observed_at":"2026-08-12T14:26:23.140851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.120884Z","title":"T2vbench: Benchmarking temporal dynamics for text-to- video generation","venue":null,"work_id":"e19283a0-cf68-4233-ad91-73d936f2e1bd","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.965283Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:9ef82b42e4e20e257df0d1cc60a48983c4a41164fb409d5186b4e059da7ebe87","observation_id":"451f920c-dbe0-4b2f-bc29-0c5d8893ca45","resolution":{"observed_at":"2026-08-12T14:26:23.125611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.106055Z","title":"Stormpy - python bind- ings for storm, 2021","venue":null,"work_id":"6c5dfe6c-e112-49c8-9152-2ab69647e10c","year":2021},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.969536Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:5539bb9626f07ab65348d16cd0b6bd7e29be584da737264bab5e52f5b82b9c05","observation_id":"8ff4d888-bd39-4f56-83dc-e42099dc3c3e","resolution":{"observed_at":"2026-08-12T14:26:23.110995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.090994Z","title":"Kemeny and J.L","venue":null,"work_id":"2674ef3a-82ee-4cc8-9bce-1086328e4a5f","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.973749Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:cdf2ac6d3f50ef661004bfce969e4ca08c48a4ecc196d334099684ae5d4d98ef","observation_id":"fa4a580f-1d92-41bc-b7ae-e6d5b0759e1f","resolution":{"observed_at":"2026-08-12T14:26:23.095564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.076407Z","title":"Joshi, Hanna Moazam, Heather Miller, Matei Zaharia, and Christopher Potts","venue":null,"work_id":"dcc02e46-d498-4741-a873-c5778457e169","year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.978158Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:ef24be461a9e640c1cf3a0782e9d2fa4dcded5f048e7157c2b1e85c3b532b1e0","observation_id":"94e37493-9c39-46ef-a091-6a4cdf4c3ee7","resolution":{"observed_at":"2026-08-12T14:26:23.081041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.061787Z","title":"Subjective-aligned dataset and metric for text-to-video qual- ity assessment, 2024","venue":null,"work_id":"5eb4944d-1a67-43e4-ad5e-cfdc635f6eba","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.982492Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:f72d8ef719d49efb5510953589d7482e3ca38fa95cd405a7b8a648063b0473d6","observation_id":"779a7ad8-e2e0-4852-91c1-3fe7079539a5","resolution":{"observed_at":"2026-08-12T14:26:23.066555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.046660Z","title":"Evaluating and improving com- positional text-to-visual generation","venue":null,"work_id":"0b119140-3417-4576-ac0a-607084f5ff59","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.986872Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:075fbaa4dc480b0261859b00d36b1e2b7e5c673c1fc8d38288827357c4b52668","observation_id":"50f4f1b9-a681-42ca-83e3-cb91a5bd82af","resolution":{"observed_at":"2026-08-12T14:26:23.051498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11027","last_updated":"2024-10-07T18:47:47Z","snapshot_observed_at":"2026-08-13T00:52:43.939424Z","submitted_at":"2024-03-16T22:14:56Z","title":"Reward Guided Latent Consistency Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11027","snapshot_observed_at":"2026-08-12T14:26:21.991425Z","title":"Reward guided latent consistency distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.991425Z"},"links":{"cited_paper":"/paper/2403.11027","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:47f88f1ede5b95b11462cdb9366377b05fb6897962a61e898850c1c6d754324f","observation_id":"5c9ca3b3-9ba9-4567-bbee-5a2766463675","resolution":{"observed_at":"2026-08-12T14:26:21.991425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18750","last_updated":"2024-10-11T07:50:49Z","snapshot_observed_at":"2026-08-12T23:55:32.837720Z","submitted_at":"2024-05-29T04:26:17Z","title":"T2V-Turbo: Breaking the Quality Bottleneck of Video Consistency Model with Mixed Reward Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18750","snapshot_observed_at":"2026-08-12T14:26:21.996386Z","title":"T2v- turbo: Breaking the quality bottleneck of video consis- tency model with mixed reward feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.996386Z"},"links":{"cited_paper":"/paper/2405.18750","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:4c01e6dd5d14603345cd02b4fa18a9f376d457fa0ea32d900e44a8fe80646cc5","observation_id":"5d4e8c6e-447c-451c-8788-3dcf96766249","resolution":{"observed_at":"2026-08-12T14:26:21.996386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.001017Z","title":"T2v- turbo-v2: Enhancing video generation model post-training through data, reward, and conditional guidance design.arXiv preprint arXiv:2410.05677, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.001017Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:e1cf53b370291710eab56c8d8f3d13daf186bdf547d8efb4fdc33a73fc4489a1","observation_id":"f63e0955-cdaa-4896-893c-86203099c359","resolution":{"observed_at":"2026-08-12T14:26:22.001017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.032153Z","title":"Ground- ing complex natural language commands for temporal tasks in unseen environments","venue":null,"work_id":"e97be4de-dc24-4a76-91bd-211a07f071ec","year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.015707Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:8471370177b493132ec2aba5834d95daacf178746bdfe151dc0016a15ad4911d","observation_id":"889db70a-03c4-491a-9925-7e6f5dc397b9","resolution":{"observed_at":"2026-08-12T14:26:23.036965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.017121Z","title":"Fetv: A bench- mark for fine-grained evaluation of open-domain text-to- video generation, 2023","venue":null,"work_id":"070b548d-3e56-43aa-b4ff-ffef8f1c8ee2","year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.020155Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:ae631e834ae20e6a722f87758d303490538ceda927bdde5a214fb44f94022132","observation_id":"dee4706e-ac74-4d53-bc5e-bbc4cb3942e3","resolution":{"observed_at":"2026-08-12T14:26:23.022279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.001943Z","title":"Evalcrafter: Benchmarking and eval- uating large video generation models","venue":null,"work_id":"abcfa618-2bfc-4496-b428-5c77671282cc","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.024525Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:c5a94cc0911bfd923ca8f3cba254bb74f652bc36ca4b372f5978ee73050597ce","observation_id":"f905f5d2-ef16-447a-b3fa-5ed569070427","resolution":{"observed_at":"2026-08-12T14:26:23.006849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.985960Z","title":"Evalcrafter: Benchmarking and eval- uating large video generation models, 2024","venue":null,"work_id":"8eea1439-3638-4231-b3d6-53a5e47806f4","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.028931Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:96ac4815771ce646dbe1b8b63d86cf1dbc62482037d111e2aa4418202b9f33e9","observation_id":"49286adc-1389-4adb-9945-ed3d1b1de31d","resolution":{"observed_at":"2026-08-12T14:26:22.991516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.970614Z","title":"Fetv: A bench- mark for fine-grained evaluation of open-domain text-to- video generation","venue":null,"work_id":"5fbb2769-b4ed-469a-9411-fd2812812026","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.033729Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:5dd6b8c6f607f3fc265057c65873c7d465855f63e1968f71442698fc64e5a30c","observation_id":"d2853179-ad90-4173-aedf-6e97d4d4b553","resolution":{"observed_at":"2026-08-12T14:26:22.975519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-12T14:26:22.038206Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.038206Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:53da5fcb4f2dce0486f032f9c82a5802eaf6f43f6fa880089f330fa749dbcbea","observation_id":"3a3b1ba7-8cfb-46a6-8704-21059dde86ed","resolution":{"observed_at":"2026-08-12T14:26:22.038206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.955944Z","title":"The Temporal Logic of Re- active and Concurrent Systems: Specification","venue":null,"work_id":"775b6075-f3b4-47ab-b6a2-1ceaf334b420","year":1992},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.043006Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:e7b9012ac8dacce1f4e9330ac1b0b03fc2a395ac5357572b0edc585510914447","observation_id":"4629eb44-2be6-459f-9cb0-249e236e39ea","resolution":{"observed_at":"2026-08-12T14:26:22.960489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.941550Z","title":null,"venue":null,"work_id":"2246f2c6-e272-4883-a9bd-357239d71cdd","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.047321Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:cfbdaef6880d4b199c67d69bcb24340a91e1095d4e3d83381a5a0a7b10e8a1c1","observation_id":"9bf9101c-a398-467a-96f7-2834d7ad3373","resolution":{"observed_at":"2026-08-12T14:26:22.946138Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.926525Z","title":"Internvl 2.0: A suite of multimodal large lan- guage models for vision and language tasks","venue":null,"work_id":"88bc3ea9-c2cb-4690-a2a0-57532afee6a0","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.051553Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:8099a62261a3b45384065374e4358bf15594c58be1071f0f36f1b69b01a5d29c","observation_id":"534af4a2-759d-4a76-a15f-fb596604b1d8","resolution":{"observed_at":"2026-08-12T14:26:22.931423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.911872Z","title":"Optimizing instructions and demonstrations for multi-stage language model programs, 2024","venue":null,"work_id":"f29efa99-3e4f-48e0-a2df-6adc0302f8d4","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.055798Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:47d910e97e102f7c65dbd38be8c849fbe2a833d92faa2db932b56d033876cfa9","observation_id":"1d8d5084-9c3e-4567-a35b-ed7710a71376","resolution":{"observed_at":"2026-08-12T14:26:22.916732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.896351Z","title":"Data-efficient learning of natural language to linear temporal logic transla- tors for robot task specification, 2023","venue":null,"work_id":"13fdb784-dcc9-44f9-92a4-d2954edef3c7","year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.060922Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:3696fd85b6bcd3478ebc2b79f227f8b83019a8c128f61908caf0a51f7c434453","observation_id":"3c1873eb-368e-419c-9b9e-cdda00a0204e","resolution":{"observed_at":"2026-08-12T14:26:22.901958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.880995Z","title":"Graph neural network (gnn) in image and video understanding using deep learning for computer vision applications","venue":null,"work_id":"f28a89a3-49a6-4247-adce-9680d6f1afe0","year":2021},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.065382Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:dbf8060e581ec4d1636de8906c90be7fcd0bc71d79dde2712d4f3d3f1a676e48","observation_id":"21b8fc4a-dd8c-46f6-9be8-573271c2f008","resolution":{"observed_at":"2026-08-12T14:26:22.886161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.865399Z","title":"The lost melody: Empirical observations on text-to-video generation from a storytelling perspective, 2024","venue":null,"work_id":"a580f328-b96a-469a-8bc0-e535e1530ad5","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.069819Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:1303aa05c9cb70d4bb81ad1e00e195186c090a70ec99deb9d03ff6cdba760ea2","observation_id":"cc835c26-698c-41bb-9cc1-e3ba70a273b6","resolution":{"observed_at":"2026-08-12T14:26:22.871122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14505","last_updated":"2025-01-15T18:57:31Z","snapshot_observed_at":"2026-08-12T23:18:27.584752Z","submitted_at":"2024-07-19T17:58:36Z","title":"T2V-CompBench: A Comprehensive Benchmark for Compositional Text-to-video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14505","snapshot_observed_at":"2026-08-12T14:26:22.074051Z","title":"T2v-compbench: A comprehen- sive benchmark for compositional text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.074051Z"},"links":{"cited_paper":"/paper/2407.14505","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:e1bf243c0ac516d996828a25d13ee354cffbf241a20734f97d24c047a5793632","observation_id":"dbcd6b75-21b6-4a85-b860-d075f2f730d1","resolution":{"observed_at":"2026-08-12T14:26:22.074051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07781","last_updated":"2024-01-15T15:42:39Z","snapshot_observed_at":"2026-08-13T04:42:41.081798Z","submitted_at":"2024-01-15T15:42:39Z","title":"Towards A Better Metric for Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07781","snapshot_observed_at":"2026-08-12T14:26:22.078469Z","title":"Towards a better metric for text-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.078469Z"},"links":{"cited_paper":"/paper/2401.07781","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:d4c7508cb4f742e1b3769d4c083189e3e720225a6cb588be8739edd41c290d43","observation_id":"b12f0e9c-2bdb-4259-ae5f-bed25f8e91d2","resolution":{"observed_at":"2026-08-12T14:26:22.078469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.850245Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"614864f6-c417-4e28-8319-852974061f87","year":2016},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.083315Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:77a113665f5ff99ca25ff55055824788929db2b0265cac3d8ccd7c99c440edc2","observation_id":"dda00750-4a51-45f1-b84a-eb0b1201c09f","resolution":{"observed_at":"2026-08-12T14:26:22.855253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10171","last_updated":"2023-09-18T21:40:08Z","snapshot_observed_at":"2026-07-06T16:20:13.025092Z","submitted_at":"2023-09-18T21:40:08Z","title":"Specification-Driven Video Search via Foundation Models and Formal Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10171","snapshot_observed_at":"2026-08-12T14:26:22.087637Z","title":"Specification-driven video search via foundation models and formal verification","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.087637Z"},"links":{"cited_paper":"/paper/2309.10171","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:50fa3760781fc7fa9a12eebbe947471ce73d3ebc7a280530fb28429aff31a898","observation_id":"52422dc3-e595-4642-8c24-e2b87d1fa2dc","resolution":{"observed_at":"2026-08-12T14:26:22.087637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-12T14:26:22.092279Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.092279Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:959416b49923f300b2111c5b8cd702b6e8c807ff40f370208d2fb55fc75b13a9","observation_id":"03bbbbc8-0f23-4abe-bab2-6225fd5a8d1d","resolution":{"observed_at":"2026-08-12T14:26:22.092279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.834984Z","title":"Celebv-text: A large-scale facial text-video dataset, 2023","venue":null,"work_id":"fe06b26d-ade3-4a8b-b8af-d37e316b39e6","year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.096996Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:728c4196842a46eb9708c1d6bb78a3af7c5e4ca9ca17e4d2ad9531f8f4b351e2","observation_id":"ba2bab75-923e-476d-8fdc-18f7c68451d3","resolution":{"observed_at":"2026-08-12T14:26:22.839826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-12T14:26:22.101268Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.101268Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:6597af17967110732af3057fde343779dd3748e40c2e0fe90fcce2ee12b739db","observation_id":"831c313d-ab1d-4c0a-9d16-62e4c81bfd8c","resolution":{"observed_at":"2026-08-12T14:26:22.101268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-12T14:26:22.106169Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.106169Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:196506b7389a12b17530ffebb0fd47ef94e0994952f1e923ef7f98ec90e98537","observation_id":"1f8edac9-55ac-4fe8-9dcc-178f6a7b44b8","resolution":{"observed_at":"2026-08-12T14:26:22.106169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.819249Z","title":"Benchmarking aigc video quality assessment: A dataset and unified model, 2024","venue":null,"work_id":"07fcccfb-1a23-4464-92e8-d4ed334c01f6","year":2024},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.110899Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:d7d1d882ea09554a23237ad3d0c5290e78b2ef85ee92b72fa3c7a04a5fb65ef0","observation_id":"af2b9744-cf36-4cc6-b554-ca5339e951d5","resolution":{"observed_at":"2026-08-12T14:26:22.824728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.804389Z","title":"Always Event A","venue":null,"work_id":"2c719e92-f8a6-4dbe-8dbe-eeb041df501f","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.115464Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:6ef31ce400375215e19adcd478920482fd76c4e68eadfd9d313015e440eef229","observation_id":"1d2d5f29-f18b-4918-b37a-d44bb086ff2c","resolution":{"observed_at":"2026-08-12T14:26:22.808978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.790025Z","title":"X i∈Ds max 0≤j≤k fT2P(Ds, i, j) # (17) DT2TL|train = arg max Ds⊂D′ T2TL,|Ds|=N","venue":null,"work_id":"cbcc25e8-207d-4614-b47f-2ce07c56e40b","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.120112Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:894d4890c9bd7716065ff14a38d52f78f1b35423ff79cbd188254abbacac6fce","observation_id":"b0c350ae-f69e-4cd0-bba5-cd6077df3c80","resolution":{"observed_at":"2026-08-12T14:26:22.794588Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.773921Z","title":"Your output fields are:","venue":null,"work_id":"c20e15ee-5a00-4669-9704-5280c7fdea79","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.124855Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:f280d572adbabd116cc49cf8fa7e46e25014877126a525573d00903b58bbdb81","observation_id":"9d8d85c8-4d5a-4d41-9416-aec33114694c","resolution":{"observed_at":"2026-08-12T14:26:22.779338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.758117Z","title":"Overall Consistency","venue":null,"work_id":"8e336516-31db-4c3a-8a9a-fb32f7c03fce","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.129848Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:3e42d68ea4d04f5fb174b5fc5ad4cbbefeb521e75a046d7ec8379f4c949964af","observation_id":"d30fb7e1-c241-455b-8ab0-144ac9315f71","resolution":{"observed_at":"2026-08-12T14:26:22.762687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.742828Z","title":"person”, “car","venue":null,"work_id":"522c6146-2379-4ff7-9915-b4cc56c0706d","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.134378Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:204113be2590d2b192e82ee9c0bf72ea1e9e5f3a18c1fda7c0aa3d16b0a28edb","observation_id":"9bac22df-1b23-4cbc-8de5-97630b3ac504","resolution":{"observed_at":"2026-08-12T14:26:22.747310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.727761Z","title":null,"venue":null,"work_id":"7402a16c-6177-41b0-b180-396c965c792e","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.138878Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:b705fd50c849879282188ebd905a73f51f38298f07bb9d945cb3f450c9ca7c28","observation_id":"cff271a8-2c5d-47e4-bb1e-e38ce80730be","resolution":{"observed_at":"2026-08-12T14:26:22.732317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.712948Z","title":"Your output fields are:","venue":null,"work_id":"c1fd1d32-e0e4-4f8d-9f27-421e1a8c222a","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.143686Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:555c8af1e9141a7e2f42bf6f079cfc25bee06ee4d563cf99bf24d36e959092bc","observation_id":"55ac61ef-b3de-4860-800e-9e2d60051a74","resolution":{"observed_at":"2026-08-12T14:26:22.717354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.698330Z","title":"Overall Consistency","venue":null,"work_id":"732ed53a-9715-4c63-956a-9fe20d7093e1","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.148306Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:02ec1b67df06a628fa0e28da8ea159874e37d3f45c461042cca2c13dd65c4baf","observation_id":"30c0455f-3ccb-4160-a863-13c9e603508a","resolution":{"observed_at":"2026-08-12T14:26:22.702885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.153051Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.153051Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:dcefb81411873729c7e1f072dc3a46c824a9a4a754ab1da3293e2d3b70f4b70f","observation_id":"55cf7e32-1fc1-40b3-89c4-c3bacf75397e","resolution":{"observed_at":"2026-08-12T14:26:22.153051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.671953Z","title":"Prompt 3","venue":null,"work_id":"be885211-9caa-4461-a5e9-3b75cf0c0309","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.157436Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:a84813b125bd6dbe6fbc47b430e7be3c86b686807ffd844f08c6bcbd5de87f71","observation_id":"afb95f78-5486-46ca-bc04-4838435e09df","resolution":{"observed_at":"2026-08-12T14:26:22.677290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.655548Z","title":null,"venue":null,"work_id":"26415866-8d6e-441d-853d-de3895c6a01c","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.162143Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:8321132d608261ce88c02335f7566b93e1dc5a5843ca0e662d00b1d9d44584fc","observation_id":"236cc62b-c292-4cf5-a5e1-d608b252fd98","resolution":{"observed_at":"2026-08-12T14:26:22.660968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.639323Z","title":"Calibration Plots","venue":null,"work_id":"f723bbd0-3bad-4be5-ae18-21d285b6c5fc","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.166484Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:953865058c2b56b10e8e3b8758484487d5547593fae7ad7b0d18f72ae74058c2","observation_id":"44439d73-5234-4358-8148-e8af95f45bac","resolution":{"observed_at":"2026-08-12T14:26:22.644076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.622798Z","title":"Nature”, “Human & Animal Activities","venue":null,"work_id":"c37109ef-c13d-40c3-a3c1-2d0ed81201d1","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.171031Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:b07f4bdc040dec3ebee6e50619f18995e9bc9348908950cda5557d64da02643e","observation_id":"a4e05ca4-afe6-455e-9ff8-ace2dbb5eeb4","resolution":{"observed_at":"2026-08-12T14:26:22.627904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.606974Z","title":null,"venue":null,"work_id":"b34c82e7-05e4-4081-86a1-5557e3cc8b94","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.176100Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:d19733a681f5ae3f5b7b7da2a644dc41e5c3aab1f0125f99869a0f104d3af814","observation_id":"7a4feb80-19e9-4884-935e-a725342bdad7","resolution":{"observed_at":"2026-08-12T14:26:22.611633Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.591506Z","title":"Always,\"","venue":null,"work_id":"34f3a6df-179f-4708-a1ca-c0ab590b0ac0","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.180814Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:29d0f189a808a4c135f28d6bfca3e8624ccea3fd8fe2472e44a8e61322c93fec","observation_id":"5983ba1e-af9a-4a90-9b67-a6fe4660e60a","resolution":{"observed_at":"2026-08-12T14:26:22.596570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:22.573994Z","title":"Always\"**: Describes an event that continuously occurs in the background or context. - **","venue":null,"work_id":"884678b7-5a6e-4603-bab8-12ea71363d90","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.185125Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:81ae0725c249637651530dfd990ec649962dc18578d6db961af1de9bbf9fd80b","observation_id":"0ab11e5f-c694-4d72-a4da-495505349824","resolution":{"observed_at":"2026-08-12T14:26:22.580643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:26:23.362302Z","title":null,"venue":null,"work_id":"38741a63-4de6-40b8-8d23-6f1e00c0198c","year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:21.865728Z"},"links":{"citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:87b49e1f59dda95f01c881c2ca144afb74a75e61c7cce30f5f3143c71fb059e2","observation_id":"f8636d89-cde1-4b8c-8523-89a29b2bff3d","resolution":{"observed_at":"2026-08-12T14:26:23.367082Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-12T14:26:22.010844Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T14:26:22.010844Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2411.16718"},"observation_digest":"sha256:0be758cc5b09277a47a9a35dc30f862e9cec19f7a363f4fb8ea94c6de8e20860","observation_id":"c9afa0cf-12c1-4f28-9dcb-4334ecd84a03","resolution":{"observed_at":"2026-08-12T14:26:22.010844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T14:19:35.300492Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":47},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:2411.16718."}