{"as_of":"2026-08-14T09:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ec2e236caf67ee6363be3028a9f662dd142a172d684930959a7b969fc8ae0908","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:10:34.717993Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09666/citation-record","integrity":"/paper/2608.09666/integrity","json":"/paper/2608.09666/citation-record.json","paper":"/paper/2608.09666"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-11T13:10:34.273827Z","title":"Qwen2.5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.273827Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:83881cd0901e157899111650eaaad2cfd6c2dda001f4093a7e87b42455cec220","observation_id":"0ce8ec41-0033-4d84-ae98-2b7e0883dc5b","resolution":{"observed_at":"2026-08-11T13:10:34.273827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.539466Z","title":"Evaluation Agent: Efficient and promptable evaluation framework for visual generative models,","venue":null,"work_id":"7632f58b-fd0a-4bec-82b1-8d7f18f2919a","year":2025},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.281730Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:0aadc86a7f8986c0d38f7d923c83fb2c2a1e210a8519956d9ec8bf0b406d3816","observation_id":"67d9b3e1-a1aa-46af-969c-78eef55aa7fd","resolution":{"observed_at":"2026-08-11T13:10:36.546122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-11T02:30:38.877941Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-11T13:10:34.288711Z","title":"Towards accurate generative models of video: A new metric & challenges,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.288711Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:b734cefd5d77cf2d017f4098eb92a49d335403a412e859846ad52bb7254fd483","observation_id":"d51bb55d-ef9d-4530-b004-e4ac10c922c1","resolution":{"observed_at":"2026-08-11T13:10:34.288711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:34.295523Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.295523Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:9120f0d6766ab0cda851fccad2f72f0fe767c2c74d93d02753bb51ed6c587d20","observation_id":"a948c38c-dd87-4d02-a0ee-1618637cd98d","resolution":{"observed_at":"2026-08-11T13:10:34.295523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.509642Z","title":"T2i-compbench: A comprehensive benchmark for open-world compositional text-to-image generation,","venue":null,"work_id":"1ec3a520-78f7-4e44-b2d7-536d07825958","year":2023},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.301963Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:4ed886be0f35115741a35b49f086f53c72d5fccb82fa8bb7ccb66d281ca60fb7","observation_id":"8683498f-8e6a-449c-af39-1306ee3b6cb7","resolution":{"observed_at":"2026-08-11T13:10:36.514802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:34.309036Z","title":"VBench: Comprehensive benchmark suite for video generative models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.309036Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:08f414349b07f8ab15fa2505478a2ff1093a709263539ef87ca219dd800814ea","observation_id":"56ace4f0-c158-4dda-9b57-846df8fd8610","resolution":{"observed_at":"2026-08-11T13:10:34.309036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.480380Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":"433c94d6-6f7c-44bf-b48d-2a7b5f90162d","year":2020},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.316725Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:10343dc4a9d1467f2169dd41d1021e6975b4d6356046627785e0503a65dab401","observation_id":"1926fd13-2cc2-455f-8a17-e65e72cd35a9","resolution":{"observed_at":"2026-08-11T13:10:36.486838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:34.323455Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.323455Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:20871a695d37d3e6ad6612107b223f2a9a6911803a1e6b4da5d367f1bdf16e59","observation_id":"cb7107c7-370c-4dba-8432-49fb0ed245a0","resolution":{"observed_at":"2026-08-11T13:10:34.323455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.450910Z","title":"Panda- 70m: Captioning 70m videos with multiple cross-modality teachers,","venue":null,"work_id":"2ee5b0de-9289-4116-83e3-2e85ac5e8b1e","year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.329660Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:ca69044606e247e8bfb56c206f28c6e899b1dd3135a8938bbcd168187fc9d2fe","observation_id":"aa6da551-973d-4fe0-bc41-6a9f6bc117a2","resolution":{"observed_at":"2026-08-11T13:10:36.456921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.432389Z","title":"Video enhancement with task-oriented flow,","venue":null,"work_id":"28c72830-5d2b-407f-bdd4-a21fbb46d952","year":2019},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.335500Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:8b76bccdb1785dcf03c433fdde229e28de6903d9a66cbdd5d7fba201bc82e174","observation_id":"bfe0e96f-3486-4fc1-9e1e-b1765795bc47","resolution":{"observed_at":"2026-08-11T13:10:36.437694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.413895Z","title":"Vbench++: Comprehensive and versatile benchmark suite for video generative models,","venue":null,"work_id":"c8f06d02-993a-4431-96e0-a2f6f0531d23","year":2026},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.341243Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:e21147cc929f0155251100f289c256afddfce2e58ac12bd49731ef822416e2f0","observation_id":"e3b501df-378b-46d2-9218-9ca7e8f17a1b","resolution":{"observed_at":"2026-08-11T13:10:36.420165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:34.347482Z","title":"Evalcrafter: Benchmarking and evaluating large video generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.347482Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:876afc8685ab9da8ded3e89de4c449b1afadc5feafc277f5955dc0eec69e8769","observation_id":"466618b1-645e-4339-a2d3-f6335af20e77","resolution":{"observed_at":"2026-08-11T13:10:34.347482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.384283Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models,","venue":null,"work_id":"80993c3e-8819-4246-8dc9-780347b1b3b7","year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.354222Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:bdadbe87b26b75c42ba54b4dd958c696f6c43631f0771c92d00d0a9f4fa4792d","observation_id":"0b97338e-38c6-4012-abba-3d1f69e9101a","resolution":{"observed_at":"2026-08-11T13:10:36.390417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:34.359831Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.359831Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:6efbe8330f49f1e46995920c3bc245dbcf3317fae2e02dd7b71f7e1321b9257c","observation_id":"e14bbe5b-0663-4032-a70d-f4411876dc4e","resolution":{"observed_at":"2026-08-11T13:10:34.359831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:34.365122Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.365122Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:de1f9ef8eefe11a36a626dee4b8a4ac399040b6986e4c892c6c0d34b2303909c","observation_id":"4692b390-534f-43ac-90d2-916e6ee2979d","resolution":{"observed_at":"2026-08-11T13:10:34.365122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.342929Z","title":"Scaling rectified flow transformers for high-resolution image synthesis,","venue":null,"work_id":"e341fcbc-4374-4a1e-b440-351101793f05","year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.371146Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:3495e4ce47d913fd7543fc27997643d1c08f526c1ee05db19b191fcc355d99c7","observation_id":"2b9bf8ef-553d-4166-b1b1-586c0d30964c","resolution":{"observed_at":"2026-08-11T13:10:36.348653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.324856Z","title":"Latte: Latent diffusion transformer for video generation,","venue":null,"work_id":"dc0cd4bd-3126-456d-80bf-3ebfa7b01e1b","year":2025},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.377213Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:0c28242142c7c262b77d8917a5e1070f7bf476d036ff9924d21827a7905d8f0c","observation_id":"891eab10-9724-4dbc-9f45-efea4e269154","resolution":{"observed_at":"2026-08-11T13:10:36.330334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-10T01:52:30.999213Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-11T13:10:34.382533Z","title":"Mod- elscope text-to-video technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.382533Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:a53a19aa76bdb0d8464b99a29c29a24a6315dc5b8a72674abf17a45b2af71780","observation_id":"32131614-b96d-4de5-9171-82b66ac2b60f","resolution":{"observed_at":"2026-08-11T13:10:34.382533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.305618Z","title":"Videocrafter2: Overcoming data limitations for high-quality video diffu- sion models,","venue":null,"work_id":"bc605851-cc1c-4c76-b6a0-3529e8b357b0","year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.388679Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:bad1df66073963234c64a9181b83c8ce8ebe7c99c2b1f4fbd40fcee2f27558ec","observation_id":"a7703b7b-ae9a-4d25-bdf8-919011621982","resolution":{"observed_at":"2026-08-11T13:10:36.311625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-13T08:59:59.906684Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-11T13:10:34.394196Z","title":"Latent video diffusion models for high-fidelity video generation with arbitrary lengths,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.394196Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:be490f30e98b9ae7f724273bf1a57a34332de452208bb26c747bb5363fb6485a","observation_id":"cb222d48-952f-41e6-af15-0d0ed195691b","resolution":{"observed_at":"2026-08-11T13:10:34.394196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:34.399728Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.399728Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:7187b8f3b38c34ca72fdde337997d57f01bfec3a3529b7b4ec00d45ff9741d05","observation_id":"3c65ca84-5049-493e-b634-5488567a0402","resolution":{"observed_at":"2026-08-11T13:10:34.399728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21755","last_updated":"2025-08-20T15:49:30Z","snapshot_observed_at":"2026-08-12T17:56:21.544451Z","submitted_at":"2025-03-27T17:57:01Z","title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21755","snapshot_observed_at":"2026-08-11T13:10:34.405066Z","title":"VBench-2.0: Advancing video generation benchmark suite for intrinsic faithfulness,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.405066Z"},"links":{"cited_paper":"/paper/2503.21755","citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:c17a42e194e3f7ef642eeaf075ee5afa9595ba1d56944abd8682da897e45a311","observation_id":"9ef1105c-3b0d-4988-9341-7a894ac0c23b","resolution":{"observed_at":"2026-08-11T13:10:34.405066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.271210Z","title":"Holistic evaluation of text- to-image models,","venue":null,"work_id":"6e0bf261-004a-48c7-af95-c9577f95ed4a","year":2023},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.410559Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:f057991c3d3504a9cbd9d39b1e308eecae10805f471c36c492db17df3047bbd8","observation_id":"e2a1f3a3-abfd-4173-8acd-7a4248f1b9c0","resolution":{"observed_at":"2026-08-11T13:10:36.277628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.252212Z","title":"T2v- compbench: A comprehensive benchmark for compositional text-to-video generation,","venue":null,"work_id":"fab32a23-2064-405e-9ed9-f675684664f9","year":2025},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.416354Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:307e6d7080e76d8b6dd19918334d7a2b12f4ecf28eb2de988b6ebfade5567d46","observation_id":"1cb80ab0-f00c-4da4-be17-8c706ec867a1","resolution":{"observed_at":"2026-08-11T13:10:36.257829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.233316Z","title":"RealUnify: Do unified models truly benefit from unification? A comprehensive benchmark,","venue":null,"work_id":"8272d122-7f41-4514-845f-e167937fd74b","year":2026},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.422723Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:57d69d3261f1c97a56db188a1aeec306ca4b137c5d2ba29a517d795ed4af3a01","observation_id":"1980a47c-d758-4e6c-a947-3e4be4d134ee","resolution":{"observed_at":"2026-08-11T13:10:36.239214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.214564Z","title":"Uni-MMMU: A massive multi-discipline multimodal unified benchmark,","venue":null,"work_id":"bad9d46e-84a2-4f51-97a6-f6cbf9b3fff7","year":2026},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.428074Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:3a100af929563d0da3719c3bf9197342fe420e3e0cbc0a14cd79054b45610909","observation_id":"1a877a63-62b2-4459-ab31-4171aa424c08","resolution":{"observed_at":"2026-08-11T13:10:36.220201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.196285Z","title":"Unison: Benchmarking unified multimodal models via synergistic understanding and generation,","venue":null,"work_id":"96d4bd50-fd65-4979-b3c5-0e1ef6b19413","year":2026},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.433565Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:f9a9c685a7d095b90a0152258bc01187ced0e3605b01d54ffd8ea4997c2819e2","observation_id":"a76b7fe1-b4a2-4447-b7a3-44b6ba3eae7e","resolution":{"observed_at":"2026-08-11T13:10:36.202093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:34.439026Z","title":"Multi-dimensional evaluation of text summarization with in-context learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.439026Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:95d763bf18e548171690131cf06d34a5e4ea2c61d0c1a51f8bf74e0f8824e211","observation_id":"bb6af445-5f93-4967-a2db-20498bdaca42","resolution":{"observed_at":"2026-08-11T13:10:34.439026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-13T11:50:17.843572Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-11T13:10:34.444699Z","title":"Can large language models be an alternative to human evaluations?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.444699Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:3a14d15303030a40832850eb556a13ae9ffa0f84bae13a2f24bbcb29b96a278e","observation_id":"f360cad3-a1a7-4b5c-820d-9cabe5ff4e23","resolution":{"observed_at":"2026-08-11T13:10:34.444699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.176826Z","title":"Gptscore: Evaluate as you desire,","venue":null,"work_id":"8099b053-2bac-4100-ab48-5eef2c2d90d7","year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.451791Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:ea2ca26117575faa279004631355602573fe5708fa03c9df168ca893ee8bf2f5","observation_id":"5138a724-6483-4c4a-8de8-b6b274f43bbf","resolution":{"observed_at":"2026-08-11T13:10:36.183048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:34.457472Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.457472Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:5c0755b2c4808c018b28a77117453b9f3a053f5d34159fba4f1e63d035134d2a","observation_id":"5f82c26d-891f-4dca-9760-8b0e6f1bffef","resolution":{"observed_at":"2026-08-11T13:10:34.457472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.140901Z","title":"Exploring the reliability of large language models as customized evaluators for diverse nlp tasks,","venue":null,"work_id":"a085d8ac-8f53-4432-b9cb-bd4a03757f9c","year":2025},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.463686Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:344a4694aba18d74300d531e7ffd42a5871653b49d238e84542c1bab0381e595","observation_id":"27b06c18-8f3c-4548-affb-c52c9f8ec0e5","resolution":{"observed_at":"2026-08-11T13:10:36.146744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.120459Z","title":"Au- tonomous evaluation and refinement of digital agents,","venue":null,"work_id":"8be4a0ea-cb54-4938-bdec-6c6fe580381f","year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.469999Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:3f6ac4b9f61be76d231a8fe90e621cae4e95a807631b9528a8e508f4eb0c19c4","observation_id":"3cfd6982-883c-45c2-a497-0c5ae3031012","resolution":{"observed_at":"2026-08-11T13:10:36.127889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:34.475664Z","title":"A survey on large language model based autonomous agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.475664Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:1b387f8e12b76b986ffbfcf69884f1cff88c1fe117c07fcffb1712060868851a","observation_id":"d9a95d08-7651-4dd2-8b5f-8e93d92bbc5f","resolution":{"observed_at":"2026-08-11T13:10:34.475664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.090229Z","title":"From generation to judgment: Opportunities and challenges of LLM-as-a-judge,","venue":null,"work_id":"254e2d60-30b4-45da-bed2-3980217504bb","year":2025},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.481986Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:d45419882580deafe384b83c3f2f96e002a68e6d603ebf576a4a41cdecc341f4","observation_id":"317db75e-6f79-4bc0-9b4a-c7b907d44b51","resolution":{"observed_at":"2026-08-11T13:10:36.096131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:34.487928Z","title":"Agent-as-a-Judge,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.487928Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:2bf5ca137291cd5884bfef4c2a70c340e0c37668a91530e1d69b49e106dbcd2f","observation_id":"23bfe681-a927-4fd4-b297-1f8a6d9c75c4","resolution":{"observed_at":"2026-08-11T13:10:34.487928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.071843Z","title":"Agent-as-a-Judge: Evaluate agents with agents,","venue":null,"work_id":"7ac6d1c1-18d3-4c05-a880-63c35b444a8c","year":2025},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.493042Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:051d73f02c464055cee7a0d1cddb3c11eb6539dcadf0fde90a7a6b892a804df2","observation_id":"97456063-a9d5-4723-93d8-aa98e61173d0","resolution":{"observed_at":"2026-08-11T13:10:36.077458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.053560Z","title":"Adaptively profiling models with task elicitation,","venue":null,"work_id":"bd02111c-1d8c-4617-a975-7bd32d79b13a","year":2025},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.498563Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:8eb80f243bb73c5e5cea3b100dbc1b31127a37594437554fb5f2153117061ab9","observation_id":"6cfbbefe-85e5-40ea-b8f4-66c4e846f40b","resolution":{"observed_at":"2026-08-11T13:10:36.059211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.034646Z","title":"Mind2Web 2: Evaluating agentic search with Agent-as-a-Judge,","venue":null,"work_id":"141e85f2-92f9-496c-9810-c456df2797da","year":2025},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.504275Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:3aefa527fc674e9b539fd841aacf0ea197851e0e000259ee7c63a4fd908db289","observation_id":"069b477f-27f9-436d-ae62-8c70bda07030","resolution":{"observed_at":"2026-08-11T13:10:36.040552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:34.509937Z","title":"One-Eval: An agentic system for automated and traceable LLM evaluation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.509937Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:671b7508bb339d8c4c5cdbe4b1d70985032544d8bdb16dd0e591ae104379f13a","observation_id":"59f83f50-386a-4d89-b8ad-59be708d796a","resolution":{"observed_at":"2026-08-11T13:10:34.509937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:36.014505Z","title":"AgenticEval: Toward agentic and self-evolving safety evaluation of large language models,","venue":null,"work_id":"07878f0f-f72a-48de-bc3a-1b35cecf8499","year":2026},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.515912Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:9ec0bd3ab254979fefa9bd57ca303385957f187dbaf910beab1be5496b9feeb8","observation_id":"cb060ea8-c4f9-45ba-a6ee-15d2b48e2974","resolution":{"observed_at":"2026-08-11T13:10:36.021413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05722","last_updated":"2024-12-07T18:44:38Z","snapshot_observed_at":"2026-08-13T00:45:20.614104Z","submitted_at":"2024-12-07T18:44:38Z","title":"Evaluating Hallucination in Text-to-Image Diffusion Models with Scene-Graph based Question-Answering Agent","version":1},"cited_work":{"arxiv_id":"2412.05722","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.05722","snapshot_observed_at":"2026-08-11T13:10:35.138865Z","title":"Evaluating Hallucination in Text-to-Image Diffusion Models with Scene-Graph based Question-Answering Agent","venue":"cs.CV","work_id":"290320a9-f034-489b-9631-9d7e87c0ff34","year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.521533Z"},"links":{"cited_paper":"/paper/2412.05722","citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:f4e6a9f63f77a94466fa044d09c70b979d17e18834c189eb90710f6a68d40e9f","observation_id":"1c1d5067-e92d-446a-b227-13c7d55f2d7b","resolution":{"observed_at":"2026-08-11T13:10:35.145783Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.996144Z","title":"A unified agentic framework for evaluating conditional image generation,","venue":null,"work_id":"538d0b3c-4d0e-4e7c-8651-bee49f619567","year":2025},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.527852Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:bea52d3e0dc8681521cdbd1c32973b4a97295ad367912253fd2d413294227370","observation_id":"ef08f582-8260-4a79-b72f-d8ce8c51fe6b","resolution":{"observed_at":"2026-08-11T13:10:36.001964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:34.534020Z","title":"EdiVal-Agent: An object-centric framework for automated, fine- grained evaluation of multi-turn editing,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.534020Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:8bd2f32383d6e8d16b9b3703a9d91986d20ec08a7873c0c6d8b9892e97af696b","observation_id":"f8f1d3d3-c7d6-4506-a6e1-fcb7cc07e9f9","resolution":{"observed_at":"2026-08-11T13:10:34.534020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08703","last_updated":"2026-05-09T05:32:48Z","snapshot_observed_at":"2026-08-11T01:26:31.712245Z","submitted_at":"2026-05-09T05:32:48Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","version":1},"cited_work":{"arxiv_id":"2605.08703","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.08703","snapshot_observed_at":"2026-08-11T13:10:35.007568Z","title":"RewardHarness: Self-Evolving Agentic Post-Training","venue":"cs.AI","work_id":"e0fb01d5-9aa2-421a-935c-25684854c9dc","year":2026},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.539760Z"},"links":{"cited_paper":"/paper/2605.08703","citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:1402ca6381adbc94e15180e6bb8e06f3b41988ec2d2c9c7c952bdadc4d4032f5","observation_id":"2765068d-88ee-48b8-9d9d-6331df4fb633","resolution":{"observed_at":"2026-08-11T13:10:35.013589Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23452","last_updated":"2025-04-27T02:59:54Z","snapshot_observed_at":"2026-08-11T15:15:48.215529Z","submitted_at":"2025-03-30T14:12:21Z","title":"VideoGen-Eval: Agent-based System for Video Generation Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23452","snapshot_observed_at":"2026-08-11T13:10:34.545499Z","title":"VideoGen-Eval: Agent-based system for video generation evaluation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.545499Z"},"links":{"cited_paper":"/paper/2503.23452","citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:e6d28c9393f6a2f52e7f4217035f2b6272d7c1ca50095513d54bd0f23b0bc63e","observation_id":"3a1ae944-f003-49cd-bb5a-9c262d9b31a4","resolution":{"observed_at":"2026-08-11T13:10:34.545499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:34.551263Z","title":"VQQA: An agentic approach for video evaluation and quality improvement,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.551263Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:0f61e0f74a93b8264e1857f2796d8521c9eb9cc951b7b1d98e7e4743bb5665b8","observation_id":"a568ed33-ab06-4704-816f-5183ef1ddc14","resolution":{"observed_at":"2026-08-11T13:10:34.551263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2608.05485","last_updated":"2026-08-06T00:28:38Z","snapshot_observed_at":"2026-08-09T23:10:55.902046Z","submitted_at":"2026-08-06T00:28:38Z","title":"VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing","version":1},"cited_work":{"arxiv_id":"2608.05485","doi":null,"metadata_source":"pith","pith_arxiv_id":"2608.05485","snapshot_observed_at":"2026-08-11T13:10:34.844171Z","title":"VideoArgus: Agentic Rubric-Grounded Unified Evaluation for Video Generation and Editing","venue":"cs.CV","work_id":"7f60e900-b370-44cc-be9a-7a8a5a375da0","year":2026},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.556555Z"},"links":{"cited_paper":"/paper/2608.05485","citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:e36d7b28be682b42e46df19a3efcfb336f452da17710de17493eda37ac3250ed","observation_id":"0a055ea0-48d5-4d28-8c40-4dbf0e375dd3","resolution":{"observed_at":"2026-08-11T13:10:34.850890Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.974560Z","title":"AgentRewardBench: Evaluating automatic evaluations of web agent trajectories,","venue":null,"work_id":"06509567-8129-4cd6-a1bb-5f16631babd3","year":2025},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.562246Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:67a31650dc398f125769c8824882a918b636926ec7d539660541101d28ee31ea","observation_id":"a4915c07-cd28-4da8-9f87-231455740a72","resolution":{"observed_at":"2026-08-11T13:10:35.981707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.955794Z","title":"AJ-Bench: Benchmarking Agent-as-a-Judge for environment-aware evaluation,","venue":null,"work_id":"2e65abfc-2c36-41cf-8bbe-675d038c794e","year":2026},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.567520Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:2cdb612e9d69efffcf31fb7d335c7e4afca405072309737be7f8911bf32fa926","observation_id":"b805a161-23ef-42b2-899e-54b29dcf7edd","resolution":{"observed_at":"2026-08-11T13:10:35.961740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19196","last_updated":"2026-05-18T23:55:08Z","snapshot_observed_at":"2026-07-06T23:29:57.003383Z","submitted_at":"2026-05-18T23:55:08Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","version":1},"cited_work":{"arxiv_id":"2605.19196","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.19196","snapshot_observed_at":"2026-08-11T13:10:34.802140Z","title":"Time to REFLECT: Can We Trust LLM Judges for Evidence-based Research Agents?","venue":"cs.CL","work_id":"758c5871-6428-4015-9a00-7da840bb54c5","year":2026},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.573818Z"},"links":{"cited_paper":"/paper/2605.19196","citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:a6c2ff4eaa590c52462b7be2f641f0d12a1e1f7a55dd64e94a107dc3c07b3ad9","observation_id":"55fbe9c5-8aad-44a1-9f4b-1665da83e741","resolution":{"observed_at":"2026-08-11T13:10:34.811346Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.934655Z","title":"Establishing best practices in building rigorous agentic benchmarks,","venue":null,"work_id":"3fdb1850-e16d-4538-9aaa-0501b2ca84c5","year":2025},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.581031Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:6aecabb9af63cf5f3f97bdb510742e509559ba92eabd2a1a16946707ead142ba","observation_id":"4892a728-5e49-4714-986d-8ce6d38c1493","resolution":{"observed_at":"2026-08-11T13:10:35.940994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.914352Z","title":"Webarena: A realistic web environment for building autonomous agents,","venue":null,"work_id":"6fd6eaf5-1576-4035-9ba9-fb5dfd055c67","year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.588041Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:5e1520a0d038b0afea78ec4f642d12e0ca3ba27c0ad9214d6adfb71cf5b68de8","observation_id":"f5b72079-8318-4c8f-9af9-c07a9d4f51c0","resolution":{"observed_at":"2026-08-11T13:10:35.920062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.895506Z","title":"Osworld: Benchmarking multimodal agents for open-ended tasks in real computer environments,","venue":null,"work_id":"423a4989-e74c-464b-9f1b-7f040eadd560","year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.595042Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:1fe45d16eb5f52ac12c9c9a8ca02aa32e8068b6296ec748e9202d0a8bd8a37b6","observation_id":"884f717c-c04c-4882-8921-73d07daa2807","resolution":{"observed_at":"2026-08-11T13:10:35.901109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.875737Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception,","venue":null,"work_id":"0b6835b8-aceb-4f6f-ad6e-48ff21404beb","year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.601006Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:920db0fe0212ade64273bf18ddceb7f3fcbf9d690b715057898cec61a82b0fca","observation_id":"5ec24db2-4335-42c0-8707-af4d624159d8","resolution":{"observed_at":"2026-08-11T13:10:35.881632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.857100Z","title":"Omniact: A dataset and benchmark for enabling multimodal generalist autonomous agents for desktop and web,","venue":null,"work_id":"7ce7c62c-5e64-4a9b-bb92-7834c8a15977","year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.608570Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:25d4c9f69de49cb1f69e46722e173ef59369c00bf551211e704b1634f72dd61c","observation_id":"0779f335-e4bc-40aa-a9e8-7f7f13f1c724","resolution":{"observed_at":"2026-08-11T13:10:35.863054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.838732Z","title":"MMInA: Benchmarking multihop multimodal internet agents,","venue":null,"work_id":"e509ee20-7b9b-47fe-9350-2daa1e30db55","year":2025},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.615477Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:9b2aef1f22dce974bb2aedd9dde07431943dd15b444d2774bee3ab8df81eb539","observation_id":"d20b6cec-7b9a-4352-983f-8470dfa8f8c4","resolution":{"observed_at":"2026-08-11T13:10:35.844739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:34.621032Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.621032Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:91ec1ac71e27ea0cd0dc8bab50f79fef3dbcd09811d7c24ce1a70e56af8dcb5d","observation_id":"15e09f98-67a5-4fc6-abea-43c5421f0cea","resolution":{"observed_at":"2026-08-11T13:10:34.621032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.808054Z","title":"Large language models are zero-shot reasoners,","venue":null,"work_id":"a82466d9-2176-4738-85ea-d894b567b402","year":2022},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.627573Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:cdc96c99bed8c1822be00c1bbfc0adc0003ad5fdfbc850fae1d617df7ececa84","observation_id":"394a836c-5f31-404a-938a-26428e3f7bd7","resolution":{"observed_at":"2026-08-11T13:10:35.813842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.788083Z","title":"React: Synergizing reasoning and acting in language models,","venue":null,"work_id":"aa87a43d-6017-48b9-b42b-459f2796530a","year":2023},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.633742Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:78a126e6469e6b3c57e57562cc1c9acbddb3e6845d00ff0faf836bcf00adb6da","observation_id":"62dfbfd9-5c76-4a20-b42d-f4073384bb7c","resolution":{"observed_at":"2026-08-11T13:10:35.795668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:34.639977Z","title":"Tree of thoughts: Deliberate problem solving with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.639977Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:a795dc801e58fc8078d8de0780a454c06386d18396fe49e9ffc87b9fc152b430","observation_id":"ec597b3a-aba7-4ed7-9f8a-611813990e26","resolution":{"observed_at":"2026-08-11T13:10:34.639977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.755455Z","title":"Algorithm of thoughts: Enhancing exploration of ideas in large language models,","venue":null,"work_id":"19585a5f-146b-4708-b6a7-5dea7493d3a6","year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.645742Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:33009c8c6f2e5edda7ec8722bb42d752be0e7d56c7a69c8316f94b297958ce58","observation_id":"e55cfbbf-f400-478b-991e-9584cd3f4c0e","resolution":{"observed_at":"2026-08-11T13:10:35.761248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:34.651497Z","title":"Graph of thoughts: Solving elaborate problems with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.651497Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:2f7af4a038f9c1f43407fc889187c09075d98c272b2024859956ac10c289f35c","observation_id":"a892988b-bd30-44b1-9cfe-1025c985f153","resolution":{"observed_at":"2026-08-11T13:10:34.651497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.721032Z","title":"Self-consistency improves chain of thought reasoning in language models,","venue":null,"work_id":"559b2611-ca34-423f-bf57-3bf04b20fa0f","year":2023},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.656757Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:6e723d7e12283b946fd8c7ab5bede74c96f302e4f28573577a48b64d9036ed19","observation_id":"76b191dc-095c-4924-bd9b-b451039044fc","resolution":{"observed_at":"2026-08-11T13:10:35.727152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.701801Z","title":"Reflexion: Language agents with verbal reinforcement learning,","venue":null,"work_id":"0ad6e775-f50e-480c-bbd0-e8eca1927a31","year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.662278Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:89a5a90ac515c855ccedb0de487b8e640251cfae87e7b9c71df3487f10615f4c","observation_id":"bb21bdbe-597c-4960-935f-d2c26ea82ddb","resolution":{"observed_at":"2026-08-11T13:10:35.707568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.683636Z","title":"Api-bank: A comprehensive benchmark for tool-augmented llms,","venue":null,"work_id":"cc6ad1b5-c920-4694-a02a-7fb8ca1d7937","year":2023},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.669165Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:0ea96f2cca91ebe3277e7e608f1f8bd63e16a459821ce869f159c4b6cebda3bf","observation_id":"57c7b42e-ed26-4ad6-927a-87324c483f98","resolution":{"observed_at":"2026-08-11T13:10:35.689207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.664645Z","title":"Toolllm: Facilitating large language models to master 16000+ real-world apis,","venue":null,"work_id":"f905d246-7f62-46e5-af8e-85937aaab0e5","year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.674523Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:0816f201492d942e510de72fb860d18e384af211e6e3fe800273733ee3dc6f02","observation_id":"c67a8f2d-6640-446c-acfe-2e2b536b9b3f","resolution":{"observed_at":"2026-08-11T13:10:35.670378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:34.680055Z","title":"Toolformer: Language models can teach themselves to use tools,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.680055Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:5073313170de544ea10afc37cb7432ecad98ac7e635dc5ce2f00602b738f6ce0","observation_id":"b15b39b5-b8e5-4919-81bd-aa13ab787c5d","resolution":{"observed_at":"2026-08-11T13:10:34.680055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.628975Z","title":"Gorilla: Large language model connected with massive apis,","venue":null,"work_id":"ef89fe16-35b7-4e53-8900-ccc325638393","year":2024},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.685517Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:111644f04d68244383c74d65932903f1c73e05aa25b30fc102497ef805ad461a","observation_id":"8154be5d-4f83-4782-a13c-cd724398a4cc","resolution":{"observed_at":"2026-08-11T13:10:35.636703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.609142Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot,","venue":null,"work_id":"e57e8fca-46ad-4451-ba4f-241640de59bf","year":2026},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.691190Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:3ebe54d379839e1284cc547c02a929e226e906f02403b2d96c8934ddfd39d1e5","observation_id":"c8a17faa-7dd2-4f7f-a83c-43090825a05b","resolution":{"observed_at":"2026-08-11T13:10:35.614941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.589529Z","title":"VChain: Chain-of-visual-thought for reasoning in video generation,","venue":null,"work_id":"a6233647-3e35-4569-9e97-4c30d8913df9","year":2026},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.696235Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:e981065d7ac167555e0eed3020cef56e697cb6a701b7ec24981687425ea0fc10","observation_id":"b61177a4-7c74-4244-b54e-69e585e58440","resolution":{"observed_at":"2026-08-11T13:10:35.595771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-08-14T06:34:01.114459Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-11T13:10:34.701245Z","title":"τ 2-Bench: Evaluating conversational agents in a dual-control environment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.701245Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:785bc302187d5fa382e1f999019adfe7b57dfb7001da0ce895ca1cf758a683da","observation_id":"8882e30d-a1af-4e9b-9776-c976ddb3d579","resolution":{"observed_at":"2026-08-11T13:10:34.701245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.571405Z","title":"An illusion of progress? assessing the current state of web agents,","venue":null,"work_id":"19d808d5-7080-48a3-b034-4559b5c8bd22","year":2025},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.706817Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:914cabb8e73d8c9c91358e8e2f61dd9627f22e73220996064e75c01b42ed150e","observation_id":"e7707f2b-9fd1-4c3b-acad-42cc919d19f1","resolution":{"observed_at":"2026-08-11T13:10:35.577136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.552247Z","title":"PaperBench: Evaluating AI’s ability to replicate AI research,","venue":null,"work_id":"4fd0126e-ff37-48f0-8306-6294718833e1","year":2025},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.712208Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:0539a3c4758f9e488a138315f31f8b3c7ae8d576e036cc4cd3d9a5c0c26a1787","observation_id":"d77e4872-7f73-4950-94e3-8a347616e4d0","resolution":{"observed_at":"2026-08-11T13:10:35.558779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:10:35.532461Z","title":"Clipscore: A reference-free evaluation metric for image captioning,","venue":null,"work_id":"4e02d905-955a-4f24-a313-cf6ad2679c0a","year":2021},"citing_paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T13:10:34.717993Z"},"links":{"citing_paper":"/paper/2608.09666"},"observation_digest":"sha256:49210ca9ce41423e0a8e788a68050a8015b5f12943372b7bf6a4be6645122f3a","observation_id":"c4903075-9b2a-4fab-a38f-4b73a59b0173","resolution":{"observed_at":"2026-08-11T13:10:35.539681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.09666","last_updated":"2026-08-10T14:42:10Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T03:09:55.365321Z","submitted_at":"2026-08-10T14:42:10Z","title":"Open Evaluation Agent: Efficient and Promptable Evaluation of Visual Generative Models"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":4,"verified_fuzzy":45},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:2608.09666."}