{"as_of":"2026-08-16T11:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4bcf9fdc6ed2cb89dc39d51bc0168efb05ec1d7d4eb30e47d8d8f7411e6086dd","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:13:08.029353Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.12290/citation-record","integrity":"/paper/2608.12290/integrity","json":"/paper/2608.12290/citation-record.json","paper":"/paper/2608.12290"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:07.885742Z","title":"Sora as an agi world model? a complete survey on text-to-video generation.arXiv preprint arXiv:2403.05131, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.885742Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:bd5e0cfcc6c3cd7a85b4f38b4768d4763dae4a9dc5975200babe7c0f8a440fb6","observation_id":"f8f95c0a-b0df-47b5-8523-e93a074d6f35","resolution":{"observed_at":"2026-08-16T00:13:07.885742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10674","last_updated":"2024-05-17T10:09:09Z","snapshot_observed_at":"2026-08-13T00:05:13.831530Z","submitted_at":"2024-05-17T10:09:09Z","title":"From Sora What We Can See: A Survey of Text-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10674","snapshot_observed_at":"2026-08-16T00:13:07.889909Z","title":"From sora what we can see: A survey of text-to-video generation.arXiv preprint arXiv:2405.10674, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.889909Z"},"links":{"cited_paper":"/paper/2405.10674","citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:84bd0aabcb7ebeb55b697846a945ed696598caa3f64796007f0b938ab01e9db9","observation_id":"c9103f11-a681-445b-a44b-e9ff486e56e0","resolution":{"observed_at":"2026-08-16T00:13:07.889909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06601","last_updated":"2018-12-03T15:12:44Z","snapshot_observed_at":"2026-08-15T12:47:37.760328Z","submitted_at":"2018-08-20T17:58:42Z","title":"Video-to-Video Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06601","snapshot_observed_at":"2026-08-16T00:13:07.893999Z","title":"Video-to-video synthesis.arXiv preprint arXiv:1808.06601, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.893999Z"},"links":{"cited_paper":"/paper/1808.06601","citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:8f4e7cb1168be974552324682de8d1e3e2099a633f8681204d35419717666dba","observation_id":"9f41bf44-4b78-4733-aaf6-c4a0cdb945f8","resolution":{"observed_at":"2026-08-16T00:13:07.893999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:07.897803Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.897803Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:b0d49637659767baf5453cef4bd3607466382d741e23aa13c603b288065b3e4a","observation_id":"22da8293-2197-4be9-8596-cd3f910ca4a8","resolution":{"observed_at":"2026-08-16T00:13:07.897803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:08.448767Z","title":"Vpo: Aligning text-to-video generation models with prompt optimization","venue":null,"work_id":"6ed1a1cb-434e-4ede-a414-6f7545600041","year":2025},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.901492Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:aaca5794aeb61ebab6fd798ad36283cbc3d16c88baf8bbfdc48edaf8a842ed19","observation_id":"97a86b19-cdfb-4996-bb06-5373d77e36a3","resolution":{"observed_at":"2026-08-16T00:13:08.452276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-14T22:40:32.716624Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-16T00:13:07.905862Z","title":"Open-sora 2.0: Training a commercial-level video genera- tion model in $200k.arXiv preprint arXiv:2503.09642, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.905862Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:96899dc00bcdfcfa0bef99345eb9b84e01224f618ffc805b65348035561d505a","observation_id":"29ccdd61-46d4-4268-88a1-48cbaa67c17e","resolution":{"observed_at":"2026-08-16T00:13:07.905862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:08.437947Z","title":"Make it move: controllable image-to- video generation with text descriptions","venue":null,"work_id":"1f1648f6-16ff-4c74-8d76-bd2ab6161e14","year":2022},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.910874Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:f8200c91866d27f8c82b4c6dae0f9c78910b3fff58dd73a7d775e21deefee64e","observation_id":"fafbe7e1-a240-4e7d-b560-1aea411dec71","resolution":{"observed_at":"2026-08-16T00:13:08.442149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:08.427829Z","title":"Prompt-a-video: Prompt your video diffusion model via preference-aligned llm","venue":null,"work_id":"8494059b-c080-4716-a1a5-8501d8e02dc3","year":2025},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.915715Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:6ce82c0fc0bf20952034a910d1a5ac1687a064b21ce5b7be4d191d06fbbff181","observation_id":"7b047e86-1dfb-43be-9482-3ea1a00badca","resolution":{"observed_at":"2026-08-16T00:13:08.430909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13393","last_updated":"2022-10-24T16:48:45Z","snapshot_observed_at":"2026-08-13T13:58:07.464977Z","submitted_at":"2022-10-24T16:48:45Z","title":"We need to talk about random seeds","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13393","snapshot_observed_at":"2026-08-16T00:13:07.919177Z","title":"We need to talk about random seeds.arXiv preprint arXiv:2210.13393, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.919177Z"},"links":{"cited_paper":"/paper/2210.13393","citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:0437e0c890713f3cf301c5d56b84f6134fc7882bb5367df48ffd3b6c33e36aec","observation_id":"aeee1728-edb0-48c4-94da-a78d5a726bd7","resolution":{"observed_at":"2026-08-16T00:13:07.919177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:08.418771Z","title":"Rethink- ing the spatial inconsistency in classifier-free diffusion guidance","venue":null,"work_id":"20cf6d06-21bc-4b9e-8c06-27d40e9138c2","year":2024},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.922856Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:39ad41e0105a5c4515baecc5bf0fe6f1dfcd6519864eb2c2c71c57583efc87a3","observation_id":"e20c3403-42fd-4898-843d-e43c073d6a2a","resolution":{"observed_at":"2026-08-16T00:13:08.421870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:08.409319Z","title":"Davidsonian scene graph: Im- proving reliability in fine-grained evaluation for text-to-image generation","venue":null,"work_id":"4cf2b289-79bd-4ac4-875b-f0a01b6faeda","year":2024},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.926505Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:f4893f793698d739332ffe41f2279aed59086b6c45ccbe63f7f45f1702e75681","observation_id":"095499db-1823-487a-a1b2-216db7450e39","resolution":{"observed_at":"2026-08-16T00:13:08.412182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:08.400238Z","title":"Generative adversarial nets.Ad- vances in neural information processing systems, 27, 2014","venue":null,"work_id":"2f9adbcd-af50-4516-9d8c-58b83855b350","year":2014},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.931198Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:d34baeb2d393c27b302987bbdbaaee0b0a96c86fbde858b58285b090ccdd8234","observation_id":"b47020f3-6d8d-4be6-8676-2b8c562c350f","resolution":{"observed_at":"2026-08-16T00:13:08.403334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:08.391445Z","title":"An introduction to variational autoencoders","venue":null,"work_id":"b0e7819e-359a-4003-9a78-f1438c554f10","year":2019},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.935930Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:2bb6cc61c62f678c2a74de5e2e5204c3465de7e6ced7f3cc3d693877039b2a1c","observation_id":"5b715188-d148-489c-826f-2a3c1806c92c","resolution":{"observed_at":"2026-08-16T00:13:08.394421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:07.939843Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.939843Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:17346c9990df8a05c38460ab2fad988e80b503f218cd19b23c3da6531f8b788e","observation_id":"c38568ca-0a37-4b95-8a3d-d2c9a9a7f250","resolution":{"observed_at":"2026-08-16T00:13:07.939843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:08.376560Z","title":"Generating videos with scene dynamics.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":"eb642a9d-2669-4a42-8dca-3ebf4370acaa","year":2016},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.942537Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:4be00ce16ee56d0366840c19b2edd6068412f8d589cb28616f63f8eebee3a02a","observation_id":"3504e273-0b37-4512-a8e4-28d86f5fa033","resolution":{"observed_at":"2026-08-16T00:13:08.380079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:07.944892Z","title":"Video generation models as world simulators.OpenAI Blog, 1:8, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.944892Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:5662d5b334d9703b742fd92324eeb256c7e374dd3a91da84403c886212a032aa","observation_id":"870864cb-e4b4-4db8-9f0b-3b9bfeae0dba","resolution":{"observed_at":"2026-08-16T00:13:07.944892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:08.360938Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"947fbba8-209f-474e-a7b7-e3c623b895bf","year":2023},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.947359Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:18ea697bec978821862fc85ff3f0d80a5c6d1777bd404875bfb127a302e93176","observation_id":"19413c11-d6c3-4c2a-adf6-f9d954f0e54c","resolution":{"observed_at":"2026-08-16T00:13:08.364388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:08.352121Z","title":"Videomar: Autoregressive video generation with continuous tokens.Advances in neural information processing systems, 38:56928– 56958, 2026","venue":null,"work_id":"dcb2de27-04bf-4db4-9573-9046e2e95b31","year":2026},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.950153Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:f16b434465b6a67f386d26d6c5803c246612a4e749a6fc977e9750ad950b5dff","observation_id":"4737dac9-b01a-4c71-9a3c-ef395f62f854","resolution":{"observed_at":"2026-08-16T00:13:08.355337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:07.953983Z","title":"Adding conditional control to text- to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.953983Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:f35f153a4904eb66981d4d0df199e789f0bb4d3d81b4142ea74528657f38747d","observation_id":"009f7f40-00ea-4dd0-ad96-c17889aa96ba","resolution":{"observed_at":"2026-08-16T00:13:07.953983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-16T00:13:07.957413Z","title":"Prompt-to-prompt image editing with cross attention control.arXiv preprint arXiv:2208.01626, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.957413Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:c1bffbb0cd6a0b2dacc307cb33fba25f99205283f773c02b5afdb85d27c34d73","observation_id":"fdb5da39-2e25-4b74-a9d5-0d86b3400b09","resolution":{"observed_at":"2026-08-16T00:13:07.957413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13840","last_updated":"2024-08-12T08:30:05Z","snapshot_observed_at":"2026-08-13T11:35:48.187609Z","submitted_at":"2023-05-23T09:03:19Z","title":"Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13840","snapshot_observed_at":"2026-08-16T00:13:07.961678Z","title":"Control-a-video: Controllable text-to-video diffusion models with motion prior and reward feedback learning.arXiv preprint arXiv:2305.13840, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.961678Z"},"links":{"cited_paper":"/paper/2305.13840","citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:e171476e1933c6a31ab3a619f214a0a393622424453273e91c7d4e4676617ed0","observation_id":"4677660a-20ef-4f54-9cb2-771010c3c817","resolution":{"observed_at":"2026-08-16T00:13:07.961678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:07.965352Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.965352Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:74c927399efedfa99a37392bbe93a86b3546fa49c4e2c1846f606ee0b94d3afd","observation_id":"ce4a85ef-1689-4ad1-b500-2808bb780b32","resolution":{"observed_at":"2026-08-16T00:13:07.965352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:08.332532Z","title":"Hard prompts made easy: Gradient-based discrete optimization for prompt tuning and discovery.Advances in Neural Information Processing Systems, 36:51008– 51025, 2023","venue":null,"work_id":"2d170c80-981d-42c8-a4f4-fdeb0a61aaa6","year":2023},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.968906Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:ab241428cd9fe26a57913827b818e2f2397095aa17d70a673e6e09fec88af6b9","observation_id":"a16255e4-5a38-47a6-868c-f8b2a87dbe2e","resolution":{"observed_at":"2026-08-16T00:13:08.335522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:07.972276Z","title":"Training diffusion models with reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.972276Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:9e7a7fff3fa0dfa41c772dc213cfea6d5c6014a19a990ac091311b3497173a8b","observation_id":"3b41dc66-33b7-48d9-9fc6-882ea0627777","resolution":{"observed_at":"2026-08-16T00:13:07.972276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19103","last_updated":"2025-08-16T03:22:02Z","snapshot_observed_at":"2026-08-14T17:07:51.295467Z","submitted_at":"2024-03-28T02:35:53Z","title":"Automated Black-box Prompt Engineering for Personalized Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19103","snapshot_observed_at":"2026-08-16T00:13:07.975903Z","title":"Automated black-box prompt engineering for personalized text-to-image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.975903Z"},"links":{"cited_paper":"/paper/2403.19103","citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:a93a301b32140e91838ff58adcfd4eacdf4c4b5a5271640f25cd6bba7d33917c","observation_id":"e9a07f51-2cec-4925-9e0d-c4b3d4a540fb","resolution":{"observed_at":"2026-08-16T00:13:07.975903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:07.980321Z","title":"Optimizing prompts for text-to-image generation.Advances in Neural Information Processing Systems, 36:66923–66939, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.980321Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:d0bed4163bfb24aee80fb278090a387e8d67234d1024ee085a7bd094e867e863","observation_id":"3e0d2840-b9bf-455c-baeb-499a845dc5ab","resolution":{"observed_at":"2026-08-16T00:13:07.980321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-16T00:13:07.984156Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.984156Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:ad4f1515f010dbc09a2d5ecef6f5278b8c55efd77d2167c9d1ae6a10ab57b7c2","observation_id":"9935308e-1195-4139-a07a-5979e6c46037","resolution":{"observed_at":"2026-08-16T00:13:07.984156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:07.987991Z","title":"Practical bayesian optimization of machine learning algorithms.Advances in neural information processing systems, 25, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.987991Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:f859e85f16da2c7c0df19e15c92ed7d15fb20dfbccdb7dc3d4132ec5a662afd0","observation_id":"387431e4-0d33-4e2f-b543-1e8862808797","resolution":{"observed_at":"2026-08-16T00:13:07.987991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-16T00:13:07.991432Z","title":"Mm-react: Prompting chatgpt for multimodal reasoning and action.arXiv preprint arXiv:2303.11381, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.991432Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:f9a6bbb962d9d6c9b060e6202ed4a5faa4f15c3f890738b9a01d11ba6a96cc89","observation_id":"ff1845b9-acc5-4ae8-8f29-449d4484db46","resolution":{"observed_at":"2026-08-16T00:13:07.991432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08857","last_updated":"2025-04-18T11:51:22Z","snapshot_observed_at":"2026-08-13T00:54:53.581123Z","submitted_at":"2024-03-13T18:00:01Z","title":"DialogGen: Multi-modal Interactive Dialogue System for Multi-turn Text-to-Image Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08857","snapshot_observed_at":"2026-08-16T00:13:07.994952Z","title":"Dialoggen: Multi-modal in- teractive dialogue system for multi-turn text-to-image generation.arXiv preprint arXiv:2403.08857, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.994952Z"},"links":{"cited_paper":"/paper/2403.08857","citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:c4c291d746ae67f338e3fb1ab5d9b7b81c29961b4ab8e95a80c44ee304399355","observation_id":"48d9777c-f819-4fe7-a286-e40bdf9d490d","resolution":{"observed_at":"2026-08-16T00:13:07.994952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07864","last_updated":"2023-09-19T08:29:18Z","snapshot_observed_at":"2026-08-09T18:54:02.679174Z","submitted_at":"2023-09-14T17:12:03Z","title":"The Rise and Potential of Large Language Model Based Agents: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07864","snapshot_observed_at":"2026-08-16T00:13:07.998387Z","title":"The rise and poten- tial of large language model based agents: A survey: arxiv preprint.arXiv preprint arXiv:2309.07864, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:07.998387Z"},"links":{"cited_paper":"/paper/2309.07864","citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:c16fc202e30c0e3d0078414d17ab983e0402201fa40567287f7714342c71209a","observation_id":"313c2745-76c7-4f70-b0cf-006006b4bee8","resolution":{"observed_at":"2026-08-16T00:13:07.998387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:08.001886Z","title":"A survey on large language model based autonomous agents.Frontiers of Computer Science, 18(6):186345, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:08.001886Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:ece06a01f22d3e605ea414e6f85ad5b73e2995c7c24e18973083218d0ae76f77","observation_id":"56392c04-b1fc-47e5-8da4-bec93729cc01","resolution":{"observed_at":"2026-08-16T00:13:08.001886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:08.300097Z","title":"Gemini 2.5 pro (gemini-2.5-pro-preview-06-05): Our most advanced intel- ligent ai model, 2025","venue":null,"work_id":"2832d9ab-72fb-4f76-bef9-b7ed234181e9","year":2025},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:08.004964Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:d554bc0bf2dc6ab574ffab3d2a6f17e6cf32702db2641feb2aee56c55be6a387","observation_id":"3f1bbdf3-e0eb-485a-8f2f-49d6de19cbbb","resolution":{"observed_at":"2026-08-16T00:13:08.303620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11527","last_updated":"2024-12-06T17:31:39Z","snapshot_observed_at":"2026-08-12T23:00:03.931899Z","submitted_at":"2024-08-21T11:06:02Z","title":"The Vizier Gaussian Process Bandit Algorithm","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11527","snapshot_observed_at":"2026-08-16T00:13:08.008273Z","title":"The vizier gaussian process bandit algorithm.arXiv preprint arXiv:2408.11527, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:08.008273Z"},"links":{"cited_paper":"/paper/2408.11527","citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:a7516629250e11ff5c73ba68ffae4d254e05be52f31299dc4b14d98aeb006173","observation_id":"5648e3d6-94d6-4b73-8f81-68340ff34574","resolution":{"observed_at":"2026-08-16T00:13:08.008273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:08.290545Z","title":"Rich human feedback for text-to-image generation","venue":null,"work_id":"4e564586-cbf5-4120-af72-9251073a2865","year":2024},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:08.012232Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:8d634e437480a72d23a222db2f6db813a7ca5c95a6dc3fcc1f410449eb71b494","observation_id":"ad494e1e-9919-4adb-88bf-3662665d8126","resolution":{"observed_at":"2026-08-16T00:13:08.293221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:08.282113Z","title":"Rich features for perceptual quality assessment of ugc videos","venue":null,"work_id":"93e7d565-5d21-4cfd-9a0d-13b62c56ec04","year":2021},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:08.014817Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:72264d56caa50c8a65b3f0a0f40d5f456c00be1b165fedd86d333a7f4f7cdf3f","observation_id":"5fe38027-2de5-4eea-aa3f-edc6530300c9","resolution":{"observed_at":"2026-08-16T00:13:08.284853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13503","last_updated":"2024-11-20T17:54:41Z","snapshot_observed_at":"2026-08-12T19:44:40.357419Z","submitted_at":"2024-11-20T17:54:41Z","title":"VBench++: Comprehensive and Versatile Benchmark Suite for Video Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13503","snapshot_observed_at":"2026-08-16T00:13:08.017256Z","title":"Vbench++: Com- prehensive and versatile benchmark suite for video generative models.arXiv preprint arXiv:2411.13503, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:08.017256Z"},"links":{"cited_paper":"/paper/2411.13503","citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:9f7e4142d7a0921808a6c749a4eb3ac98e6ff9a4243ae52d976badef188d10b2","observation_id":"a43342f7-5eb8-404a-9421-f8e41af0258f","resolution":{"observed_at":"2026-08-16T00:13:08.017256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:08.273422Z","title":"The devil is in the prompts: Retrieval-augmented prompt optimiza- tion for text-to-video generation","venue":null,"work_id":"e9cec105-fffb-44e6-bbfa-e80c0b2c5bec","year":2025},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:08.019856Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:cb45970a89a424219e8d5d7a4968bf67156c8d2b2edf69b496e72dd7901b4b49","observation_id":"77ac2cfb-e69e-4380-903e-8e912f731cc0","resolution":{"observed_at":"2026-08-16T00:13:08.276333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:08.262961Z","title":"Q-bench-video: Benchmark the video quality understanding of lmms","venue":null,"work_id":"1fa2dbe3-137f-45d4-888b-e119a7c649e5","year":2025},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:08.022536Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:8157e1dc03558b3111f842a395b981626f7c1926c8a99730c0121c3382d9981d","observation_id":"a20b9f1b-bf11-4e22-bff7-e6d5ed9f040e","resolution":{"observed_at":"2026-08-16T00:13:08.267250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-16T00:13:08.025654Z","title":"Gemini robotics: Bringing ai into the physical world.arXiv preprint arXiv:2503.20020, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:08.025654Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:c92f8fab7864ee0423e075a6c5d5a0292cd380ca95312e2153d4bc68dc562fcd","observation_id":"31b2333c-fe95-4ddc-8ffb-fb3b95fc08b0","resolution":{"observed_at":"2026-08-16T00:13:08.025654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:13:08.252541Z","title":"scene_graph","venue":null,"work_id":"f1a14fc0-2e00-44c0-b3ca-b99cbe707c6a","year":2023},"citing_paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:13:08.029353Z"},"links":{"citing_paper":"/paper/2608.12290"},"observation_digest":"sha256:65c14c24eae9ba6520b2c98a21b2fb1480b16f7c465cdb7108fa1b0867b5d32f","observation_id":"7a5df1fe-2ad0-4c0d-96a6-ca21014bf6a1","resolution":{"observed_at":"2026-08-16T00:13:08.256619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.12290","last_updated":"2026-08-12T17:35:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T09:14:13.842241Z","submitted_at":"2026-08-12T17:35:16Z","title":"Beyond Trial-and-Error: Agentic Optimization for Image-to-Video Adherence"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2608.12290."}