{"as_of":"2026-08-08T07:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6f18e9cc71e4c1ae05b25fc7f7bb739827ba7e754c08f6bc6e9aab8cd2cd7daf","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:17:46.458920Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:49:31.003751Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-07T23:45:43.414440Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2406.08656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-07-04T03:49:31.003751Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":"50e0fb69-6381-494d-88d2-db24b71f4286","year":2024},"citing_paper":{"arxiv_id":"2504.17180","last_updated":"2026-04-03T02:52:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-24T01:34:12Z","title":"We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T18:56:39.735334Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2504.17180"},"observation_digest":"sha256:335d852c0cc551eb95cd1dca3a4361a71300a795593e5e9da049a4e966b1a82d","observation_id":"24e2b302-5f59-4efa-9066-1467aaa50ebf","resolution":{"observed_at":"2026-05-22T18:56:58.222912Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-07T23:45:43.414440Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-07T05:41:39.629628Z","title":"Tc-bench: Benchmark- ing temporal compositionality in text-to-video and image-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07371","last_updated":"2025-06-10T13:33:53Z","snapshot_observed_at":"2026-08-07T10:51:02.440475Z","submitted_at":"2025-06-09T02:42:13Z","title":"ARGUS: Hallucination and Omission Evaluation in Video-LLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:41:39.629628Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2506.07371"},"observation_digest":"sha256:202d5a72526255ab6ad46fd5b4312efee5bd5dc1f17e4cacd0b5160ba68c05b1","observation_id":"f9d3a925-7cf2-41e0-8c54-ce28d147afb5","resolution":{"observed_at":"2026-08-07T05:41:39.629628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-07T23:45:43.414440Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-07T10:17:46.458920Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10019","last_updated":"2025-06-06T11:09:46Z","snapshot_observed_at":"2026-08-07T20:45:05.929732Z","submitted_at":"2025-06-06T11:09:46Z","title":"A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:46.458920Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2506.10019"},"observation_digest":"sha256:a7be72b1fedf192be80ef246ccc7e3cf7bc1bfc6795e9d8a6ccb0a2338ba0661","observation_id":"ab23c3cf-1d1e-496d-9759-c525e4513816","resolution":{"observed_at":"2026-08-07T10:17:46.458920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-07T23:45:43.414440Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-06T14:43:26.566236Z","title":"Tc-bench: Benchmarking temporal compositionality in text-to-video and image-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18107","last_updated":"2025-07-24T05:37:08Z","snapshot_observed_at":"2026-08-07T22:04:50.712614Z","submitted_at":"2025-07-24T05:37:08Z","title":"T2VWorldBench: A Benchmark for Evaluating World Knowledge in Text-to-Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:26.566236Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2507.18107"},"observation_digest":"sha256:30802dc1040ce8339278658bb9313614b549ccdb11e3384d4c1c61426d0a755f","observation_id":"f2308e59-9a08-42ce-a73a-64f2db7c1330","resolution":{"observed_at":"2026-08-06T14:43:26.566236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-07T23:45:43.414440Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-03T13:01:58.045344Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01095","last_updated":"2026-08-02T22:17:06Z","snapshot_observed_at":"2026-08-06T23:24:03.757272Z","submitted_at":"2026-01-03T07:12:55Z","title":"NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T13:01:58.045344Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2601.01095"},"observation_digest":"sha256:7fff5a587b6430ecb825d4905622c1361cf40e89a91bd5c5f2e43dabd267c8ba","observation_id":"070e9f70-c0f7-4fc6-813a-ad34bd17ea0e","resolution":{"observed_at":"2026-08-03T13:01:58.045344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-07T23:45:43.414440Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-04T06:36:33.811054Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.01095","last_updated":"2026-08-02T22:17:06Z","snapshot_observed_at":"2026-08-06T23:24:03.757272Z","submitted_at":"2026-01-03T07:12:55Z","title":"NarrativeTrack: Evaluating Entity-Centric Reasoning for Narrative Understanding","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T06:36:33.811054Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2601.01095"},"observation_digest":"sha256:ee75ef2c86fb021c075858254c8e6f85f12d46356dda2a32c4fee78cdede6ea6","observation_id":"f7706508-171a-4b27-b1a5-33634d400074","resolution":{"observed_at":"2026-08-04T06:36:33.811054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-07T23:45:43.414440Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2406.08656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-07-04T03:49:31.003751Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":"50e0fb69-6381-494d-88d2-db24b71f4286","year":2024},"citing_paper":{"arxiv_id":"2604.19092","last_updated":"2026-05-14T07:32:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T05:09:56Z","title":"RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T03:02:26.084185Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2604.19092"},"observation_digest":"sha256:e35ea70a68517db3a8daaf3f8a507205ac6a8f69609a7e6c4ef44f6dc7a10b09","observation_id":"eed2fe64-e570-4751-8fc1-4a7c37f37f1a","resolution":{"observed_at":"2026-05-10T03:03:37.455762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-07T23:45:43.414440Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2406.08656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-07-04T03:49:31.003751Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":"50e0fb69-6381-494d-88d2-db24b71f4286","year":2024},"citing_paper":{"arxiv_id":"2604.19092","last_updated":"2026-05-14T07:32:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-21T05:09:56Z","title":"RoboWM-Bench: A Benchmark for Evaluating World Models in Robotic Manipulation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T06:15:32.881140Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2604.19092"},"observation_digest":"sha256:0da38c2792018953b411e3e8eef7d666b67a7bb01e84993c223387ebbaad3669","observation_id":"319912a3-7652-4639-ac05-94c56e90beeb","resolution":{"observed_at":"2026-05-15T06:19:50.198674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-07T23:45:43.414440Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2406.08656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-07-04T03:49:31.003751Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":"50e0fb69-6381-494d-88d2-db24b71f4286","year":2024},"citing_paper":{"arxiv_id":"2605.23699","last_updated":"2026-05-22T14:51:22Z","snapshot_observed_at":"2026-07-06T23:33:53.870540Z","submitted_at":"2026-05-22T14:51:22Z","title":"CRONOS: Benchmarking Counterfactual Physical Consistency in Video Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T04:39:22.400458Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2605.23699"},"observation_digest":"sha256:fb8740efb71c77e416ad3639aff6b4dab3ad7af05285bcad095f643ddea10d67","observation_id":"d9c6c93f-4d63-40ca-a3a5-deb230cecd16","resolution":{"observed_at":"2026-05-25T04:40:23.130772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-07T23:45:43.414440Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2406.08656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-07-04T03:49:31.003751Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":"50e0fb69-6381-494d-88d2-db24b71f4286","year":2024},"citing_paper":{"arxiv_id":"2605.26244","last_updated":"2026-05-25T18:12:09Z","snapshot_observed_at":"2026-08-06T05:46:08.521756Z","submitted_at":"2026-05-25T18:12:09Z","title":"LongAV-Compass: Towards Unified Evaluation of Minute-Scale Audio-Visual Generation Across T2AV, I2AV, and V2AV","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T22:52:38.330851Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2605.26244"},"observation_digest":"sha256:e0c181fb91823716a891e0c214b3a3072021d75dad1cfcbee3df69fd55fae9b9","observation_id":"42c44632-6e7c-4385-a01e-cb5d6b8075c6","resolution":{"observed_at":"2026-06-29T22:54:00.793852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-07T23:45:43.414440Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2406.08656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-07-04T03:49:31.003751Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":"50e0fb69-6381-494d-88d2-db24b71f4286","year":2024},"citing_paper":{"arxiv_id":"2606.01164","last_updated":"2026-05-31T11:12:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T11:12:30Z","title":"Towards Interactive Video World Modeling: Frontiers, Challenges, Benchmarks, and Future Trends","version":1},"reference_index":134,"source":"pdf_text","source_observed_at":"2026-06-28T17:29:18.513507Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2606.01164"},"observation_digest":"sha256:bce84672184c279dd106a9f6808ec8df04f8a32a59fe8d54703bff05159249b2","observation_id":"b2015940-614c-4655-a5ad-580580669802","resolution":{"observed_at":"2026-07-01T21:06:14.094042Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-07T23:45:43.414440Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2406.08656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-07-04T03:49:31.003751Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":"50e0fb69-6381-494d-88d2-db24b71f4286","year":2024},"citing_paper":{"arxiv_id":"2606.10620","last_updated":"2026-06-09T09:17:55Z","snapshot_observed_at":"2026-08-02T16:01:56.626147Z","submitted_at":"2026-06-09T09:17:55Z","title":"Can Image Models Imagine Time? ImageTime: A Novel Benchmark for Probing Visual World Modeling Through Spatiotemporal Consistency","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T13:34:25.079037Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2606.10620"},"observation_digest":"sha256:70f2a36bbff4622adfa7d42322b2451d4a2ee11ecd0c695b429e5cdd52a67ee6","observation_id":"01349f55-1a4f-44c8-86dd-85674ac5176b","resolution":{"observed_at":"2026-07-03T04:57:38.101059Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-07T23:45:43.414440Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2406.08656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-07-04T03:49:31.003751Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":"50e0fb69-6381-494d-88d2-db24b71f4286","year":2024},"citing_paper":{"arxiv_id":"2606.20545","last_updated":"2026-06-18T17:55:15Z","snapshot_observed_at":"2026-07-06T23:55:38.979306Z","submitted_at":"2026-06-18T17:55:15Z","title":"Current World Models Lack a Persistent State Core","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T17:33:41.461245Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2606.20545"},"observation_digest":"sha256:1272f04822cde6c607ffc8c15ce8c930396754b19a1e44d7a7732a565aa92d0a","observation_id":"1287a9a5-e700-4982-99b2-cbe2f21ee39a","resolution":{"observed_at":"2026-07-04T03:49:31.006734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-07T23:45:43.414440Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-07-14T03:51:24.547781Z","title":"arXiv preprint arXiv:2406.08656 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11689","last_updated":"2026-07-13T15:22:56Z","snapshot_observed_at":"2026-08-02T18:20:32.168835Z","submitted_at":"2026-07-13T15:22:56Z","title":"From World Action Models to Embodied Brains: A Roadmap for Open-World Physical Intelligence","version":1},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-07-14T03:51:24.547781Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2607.11689"},"observation_digest":"sha256:5474274e4637d6cee4a1d711edd62dafbe9eec92c37e951a8d96d23d861ec1fc","observation_id":"e92bca83-aa2c-4ec9-8b0f-80b4951b5ec4","resolution":{"observed_at":"2026-07-14T03:51:24.547781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","snapshot_observed_at":"2026-08-07T23:45:43.414440Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08656","snapshot_observed_at":"2026-08-02T04:57:34.021666Z","title":"arXiv preprint arXiv:2406.08656 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13527","last_updated":"2026-07-15T07:26:05Z","snapshot_observed_at":"2026-08-05T04:43:47.810355Z","submitted_at":"2026-07-15T07:26:05Z","title":"VGIF-Score: Interpretable and Diagnostic Evaluation of Spatio-Temporal Instruction Following in Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T04:57:34.021666Z"},"links":{"cited_paper":"/paper/2406.08656","citing_paper":"/paper/2607.13527"},"observation_digest":"sha256:07aa7ea885fbaf22ec5eb442cd9de4a506147ee0b69a4b90566f024217420d27","observation_id":"763678e9-f1d8-4bc6-81bc-4e197037d136","resolution":{"observed_at":"2026-08-02T04:57:34.021666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.08656/citation-record","integrity":"/paper/2406.08656/integrity","json":"/paper/2406.08656/citation-record.json","paper":"/paper/2406.08656"},"outbound":[],"paper":{"arxiv_id":"2406.08656","last_updated":"2024-06-12T21:41:32Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:45:43.414440Z","submitted_at":"2024-06-12T21:41:32Z","title":"TC-Bench: Benchmarking Temporal Compositionality in Text-to-Video and Image-to-Video Generation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2406.08656."}