{"as_of":"2026-08-15T22:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:235dd95397ba4f03f2f3c07668b07e9de5e663e85fd55d0255b8d06a0be45569","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:12:37.935546Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T16:07:49.790348Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13851","snapshot_observed_at":"2026-07-12T05:50:16.895740Z","title":"arXiv preprint arXiv:2505.13851 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02959","last_updated":"2026-07-03T05:05:59Z","snapshot_observed_at":"2026-08-14T18:17:57.192099Z","submitted_at":"2026-07-03T05:05:59Z","title":"Incentivizing Vision Language Models to Search for Long Video Question Answering","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T05:50:16.895740Z"},"links":{"cited_paper":"/paper/2505.13851","citing_paper":"/paper/2607.02959"},"observation_digest":"sha256:3bab98f94e2e3acfdf74a927bad5adc5dc8949b4e3190308417b6cd7ebae35bb","observation_id":"867abc38-38c6-4c4c-9dcd-95d244eecd0f","resolution":{"observed_at":"2026-07-12T05:50:16.895740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13851","snapshot_observed_at":"2026-08-01T16:07:49.790348Z","title":"arXiv preprint arXiv:2505.13851 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18116","last_updated":"2026-07-20T16:11:19Z","snapshot_observed_at":"2026-08-14T10:04:06.196053Z","submitted_at":"2026-07-20T16:11:19Z","title":"SGA: Plug&Play Geometric Verification for Educational Video Synthesis","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T16:07:49.790348Z"},"links":{"cited_paper":"/paper/2505.13851","citing_paper":"/paper/2607.18116"},"observation_digest":"sha256:1cf44b7fef252a2088d9a5094f5b2f864d985162346d5089188b1991a64a2811","observation_id":"b6c0e8fb-65bf-418e-bb05-2d0f6145cbbc","resolution":{"observed_at":"2026-08-01T16:07:49.790348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.13851/citation-record","integrity":"/paper/2505.13851/integrity","json":"/paper/2505.13851/citation-record.json","paper":"/paper/2505.13851"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.937894Z","title":"In 2019 IEEE 58th conference on decision and control (CDC), pages 5338--5343","venue":null,"work_id":"d8bf5611-a18a-4580-b439-264c97936014","year":2019},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.630186Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:dac640830c4752672bd6dbb3d8f116de65b76ae579b4a7beffe8103dbb6e372c","observation_id":"9735a573-7a8c-4871-9572-e3aec62cc635","resolution":{"observed_at":"2026-08-15T20:12:38.942311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.924734Z","title":"Principles of Model Checking","venue":null,"work_id":"cc164c74-9f54-4eb4-bd0d-8a8bceea2214","year":2008},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.640288Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:348d77cd2241413d0c12fc93636fc65109984b3530c1583a40f1fa966211c1ac","observation_id":"6831c3f7-23a4-4c98-b754-46db89b2556a","resolution":{"observed_at":"2026-08-15T20:12:38.929596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.911814Z","title":null,"venue":null,"work_id":"ead67b11-59eb-4f8f-96b7-a94ea19ade39","year":2021},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.644893Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:51a9bf44f695442be1788a27fb9e380bc1041f1c3105d519a7b62fe064fca8fc","observation_id":"fa7957a3-740f-450a-a5d2-5c3cfd51d01f","resolution":{"observed_at":"2026-08-15T20:12:38.916064Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.898423Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":"4bbbd346-37d7-4559-821b-e7ae04c8bdce","year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.648868Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:dfd0b6fbe369e3c5ce2560a63eda2f621200b43932859ec5274690b2e38825f1","observation_id":"53a35f3f-d6a7-4351-ac3d-15ad2981c3a0","resolution":{"observed_at":"2026-08-15T20:12:38.903547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.881953Z","title":"Hourvideo: 1-hour video-language understanding","venue":null,"work_id":"a37acfe9-d5d8-409f-b358-992aeb7b0597","year":2025},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.653109Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:4d28bc85ab8599934a89ff7c83e6356f3b3a11e289b7719f6caf0c3876777985","observation_id":"bc7292ec-8497-4bd6-8fb1-21fc3a270c1c","resolution":{"observed_at":"2026-08-15T20:12:38.889158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.865288Z","title":"Langchain, 2022","venue":null,"work_id":"f3c3f475-d964-45d8-9fcc-d72edbe2d7fc","year":2022},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.658651Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:ec4b64614c6abe71fa5a8c2495b87f057902d56642a26644c70da5b607a5d822","observation_id":"e138589a-bdaa-4835-8546-1350f997621a","resolution":{"observed_at":"2026-08-15T20:12:38.870148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01089","last_updated":"2022-05-02T17:59:13Z","snapshot_observed_at":"2026-08-13T15:51:54.085970Z","submitted_at":"2022-05-02T17:59:13Z","title":"ComPhy: Compositional Physical Reasoning of Objects and Events from Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01089","snapshot_observed_at":"2026-08-15T20:12:37.662733Z","title":"Comphy: Compositional physical reasoning of objects and events from videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.662733Z"},"links":{"cited_paper":"/paper/2205.01089","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:b2dad0155140825675dcb3329bf2d2330c9df37abd400e1e80f0175c9b3bff20","observation_id":"8ff190ce-6749-488c-b5f4-47a00bcbc4f0","resolution":{"observed_at":"2026-08-15T20:12:37.662733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.851313Z","title":"Choudhary","venue":null,"work_id":"3bc6e01f-524a-48f3-a1f1-d65cdf56e595","year":2014},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.667154Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:370bbe1f60c15f945746b77793c89f570f3d7c0c4ce2fbee4e3dcbd6cccd766b","observation_id":"f0f2c29c-4a05-499b-90b5-46ffa52a3be2","resolution":{"observed_at":"2026-08-15T20:12:38.856281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:37.671159Z","title":"Sora as an agi world model? a complete survey on text-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.671159Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:82cef4ced028dc6bf94f3058266ce08b8021daa316a6fa3c092f68cf2c9bef03","observation_id":"7567b5ad-4d7e-4c92-b450-9a7cf46da630","resolution":{"observed_at":"2026-08-15T20:12:37.671159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.838701Z","title":"Towards neuro-symbolic video understanding","venue":null,"work_id":"39d787a9-ac5a-4b7e-a972-80195c565375","year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.676258Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:d1cdfde0a6566459b6994e6a80c1cd608144798c8ea01169f4dbd6e761691c2d","observation_id":"41cd61bd-5fbe-40b1-86d6-ef7acece1221","resolution":{"observed_at":"2026-08-15T20:12:38.843209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17180","last_updated":"2026-04-03T02:52:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-24T01:34:12Z","title":"We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback","version":4},"cited_work":{"arxiv_id":"2504.17180","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.17180","snapshot_observed_at":"2026-08-15T20:12:38.205428Z","title":"We'll Fix it in Post: Improving Text-to-Video Generation with Neuro-Symbolic Feedback","venue":"cs.CV","work_id":"eebcbf55-4dfb-40cb-ab2f-5eefbcfc0488","year":2025},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.680624Z"},"links":{"cited_paper":"/paper/2504.17180","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:88221a25b6dd47b7decbe510a34ee496ec115d350992c00166a7f1fd9409b80b","observation_id":"b92ae639-df77-4e2b-b643-75e8bf5ceb04","resolution":{"observed_at":"2026-08-15T20:12:38.209822Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05519","last_updated":"2025-05-08T03:27:12Z","snapshot_observed_at":"2026-08-14T13:11:57.934087Z","submitted_at":"2025-05-08T03:27:12Z","title":"Real-Time Privacy Preservation for Robot Visual Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05519","snapshot_observed_at":"2026-08-15T20:12:37.685123Z","title":"Real-time privacy preservation for robot visual perception","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.685123Z"},"links":{"cited_paper":"/paper/2505.05519","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:4a62511f09225ddde71a6c45235bf762c2436bb527be13f297551d3da50a457a","observation_id":"e81aebdd-a2e9-4d82-97ae-ecd6cf9e27ee","resolution":{"observed_at":"2026-08-15T20:12:37.685123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.824352Z","title":"Parks research shows consumers are after integrated smart locks and security cameras","venue":null,"work_id":"afab0836-0aad-4afe-adfa-e5acd27eae81","year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.690148Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:977e49d5686c2ae8138dbe588d212883c6cc96af4231db67b314c851b89f8b19","observation_id":"cc4d308a-aecf-4269-8762-95f95dcfa416","resolution":{"observed_at":"2026-08-15T20:12:38.829994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.810550Z","title":"Towards interpretable video anomaly detection","venue":null,"work_id":"06da3c5c-b8c3-4fc6-b113-848567e26a4c","year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.695012Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:2b9ee2475992e3f71f18864149fd5c0a84bec585795838132ebf31875f3fa2b1","observation_id":"a497cb8d-e782-4998-ba07-9f13565de877","resolution":{"observed_at":"2026-08-15T20:12:38.814856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.796088Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":"ceef33c8-55fe-4cff-a51d-a50eabaf865d","year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.698686Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:41192808e211b09eb11ab0badf7b5b889ea71ef56e6425d68dc552b34407c632","observation_id":"bc736d57-a10b-4d3f-8286-96d77fc033e0","resolution":{"observed_at":"2026-08-15T20:12:38.802099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.783969Z","title":"Convolutional two-stream network fusion for video action recognition","venue":null,"work_id":"773ba70e-7b88-429d-86a3-bec96a832d32","year":1933},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.702757Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:b1b8330dbe5afc049ae59706237dff325c5f811252fd8731474ec1278394e8e3","observation_id":"b4e23337-d344-4b8a-ad19-e4a2875b2b69","resolution":{"observed_at":"2026-08-15T20:12:38.788177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.772805Z","title":null,"venue":null,"work_id":"37745879-2e4c-45ff-bea3-49ee95515125","year":2017},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.707375Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:1fc261db17ed0e04f8cbc641715c162d6dae6743baebe6791544562c5e386504","observation_id":"f1ccf334-3cc6-4ed8-8712-5a9590d99c4e","resolution":{"observed_at":"2026-08-15T20:12:38.776491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.758854Z","title":"Slowfast networks for video recognition","venue":null,"work_id":"07eed355-4c96-4187-836f-bc34e159ccff","year":2019},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.711222Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:626e6bff185be889226e9c631143c8fc00eddd401d616099e5d54ffb02aa52c0","observation_id":"60f6e5dd-3ebf-49d7-9ad1-57a97330a47e","resolution":{"observed_at":"2026-08-15T20:12:38.763897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:37.715130Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.715130Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:44445fb8fecbccfd606b379488cc11e25cf596cb234d00435d0d5913d1bab8f9","observation_id":"6948090a-3e78-45bc-b4ce-68050aead013","resolution":{"observed_at":"2026-08-15T20:12:37.715130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.739661Z","title":"The efficacy of neural planning metrics: A meta-analysis of pkl on nuscenes","venue":null,"work_id":"1cb89f38-04a9-485d-a4c9-d96f779eb025","year":2020},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.719067Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:e2f9615097453c3722c40bd3a89a48468554920b95a3d7717e4d809fc0af195b","observation_id":"7e33e310-d468-4f3d-9a4f-e9a68882dcd4","resolution":{"observed_at":"2026-08-15T20:12:38.743640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:37.722597Z","title":"Stabletoolbench: Towards stable large-scale benchmarking on tool learning of large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.722597Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:28b39a570c12cee9b83cdbc8c9f653a48bab15ecfb4d2a2e3c411246eb39529d","observation_id":"eaafed71-be0e-4534-99f8-7f53631625ac","resolution":{"observed_at":"2026-08-15T20:12:37.722597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:37.726478Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.726478Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:e9d0c0ff05f03ca382518a5082c69a2cfda7c81694c95cf01944ceb2d60b36d4","observation_id":"f1b4c00d-c025-4014-927a-7ba6fb8797a5","resolution":{"observed_at":"2026-08-15T20:12:37.726478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-15T20:12:37.731908Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.731908Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:58b44e9b0b5942feac76d1b150c1f8f2045d37b28a49ce0e43cf8c2f571a1d58","observation_id":"aabb3fd2-ea12-48ac-a8e0-b8e93c839fd8","resolution":{"observed_at":"2026-08-15T20:12:37.731908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:37.736434Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.736434Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:73fdde867cbeff519c43494c0404779eed6b1500a1d7cc82000dd35a9b99cdde","observation_id":"24809207-4feb-476d-ac2f-75e755ac1b33","resolution":{"observed_at":"2026-08-15T20:12:37.736434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20252","last_updated":"2024-10-26T19:01:06Z","snapshot_observed_at":"2026-08-14T18:55:43.856492Z","submitted_at":"2024-10-26T19:01:06Z","title":"Adaptive Video Understanding Agent: Enhancing efficiency with dynamic frame sampling and feedback-driven reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20252","snapshot_observed_at":"2026-08-15T20:12:37.741594Z","title":"Adaptive video understanding agent: Enhancing efficiency with dynamic frame sampling and feedback-driven reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.741594Z"},"links":{"cited_paper":"/paper/2410.20252","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:eb3995c4095140a0fcad457c367e5eb2cd3a83005506deca1004026bcf1d3f5a","observation_id":"dbc2d06c-2170-4dbd-991e-607de1ab895a","resolution":{"observed_at":"2026-08-15T20:12:37.741594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.706612Z","title":"Safe autonomy under perception uncertainty using chance-constrained temporal logic","venue":null,"work_id":"581f1a16-81ff-484d-b652-20450c0877cb","year":2018},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.745875Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:2ed251ccdaeec33768e5bf501778e5feee0465d941158fce7f60803ee996416b","observation_id":"dce12e36-8334-4b06-a80c-f6469c6690be","resolution":{"observed_at":"2026-08-15T20:12:38.710616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:37.750582Z","title":"Tsaftaris, and Aggelos K","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.750582Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:c289477a0fe85ec6351cfded0d97f08fb1ca7e89e6c20165d48852ea00f5da83","observation_id":"29778a5f-0ac2-4fef-b8a9-12399fdaef42","resolution":{"observed_at":"2026-08-15T20:12:37.750582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.693585Z","title":"Temporal-logic-based reactive mission and motion planning","venue":null,"work_id":"4c30cfd2-ffb5-4ea3-a863-a6d980dd03ae","year":2009},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.754257Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:b91e3ff9eeae18330c1c0c527cabab9aaaadd5ee4704a709592820a27e7cba28","observation_id":"9b337289-ff70-4f8c-b2f5-2096e55c4c3b","resolution":{"observed_at":"2026-08-15T20:12:38.698024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.681975Z","title":"A neural-symbolic approach to computer vision","venue":null,"work_id":"b31c2e2a-bc5a-4d43-93de-266299f3ba20","year":2021},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.758293Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:e56900d8d739465a2606dc4f9b920c9531d28b0384767fdbafc5d2d9e7ec0a89","observation_id":"8097b98c-0bf9-4b2a-b7be-5b3080cf7bcf","resolution":{"observed_at":"2026-08-15T20:12:38.686308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.669817Z","title":"Pika ai: Free video generator with scene ingredients, 2024","venue":null,"work_id":"e78eaef7-8423-40d8-b463-a8845ad9f9f7","year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.762797Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:60ecfd3902f52aa6e1137ade3cf6cab0feac5f04e0c4408fdbe0a60073cabf6a","observation_id":"bed02405-314a-4689-b528-ff84e779a6d9","resolution":{"observed_at":"2026-08-15T20:12:38.674115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.657561Z","title":"Human-related anomalous event detection via spatial-temporal graph convolutional autoencoder with embedded long short-term memory network","venue":null,"work_id":"7ace1844-3641-4f33-88e2-b2b7af4450c6","year":2022},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.766489Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:a4b9fd84193ae99aca4cd8f83032afed3e7df61e0c0b28e7d6f9f55e2096a5ad","observation_id":"738b471e-f590-44a0-90d8-0a6cb0d28167","resolution":{"observed_at":"2026-08-15T20:12:38.661618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-15T20:12:37.770125Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.770125Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:e4f423f2529cf38b9b04c9c95d93cd607166f23a2af8839b0ab29872838fed41","observation_id":"2335cd9b-cab6-4e81-86b0-eae069542e70","resolution":{"observed_at":"2026-08-15T20:12:37.770125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.645659Z","title":"Representation learning on visual-symbolic graphs for video understanding","venue":null,"work_id":"526daa50-5666-4c27-9329-6d4c1a0fcad9","year":2020},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.774332Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:d732e69c1d1a95ef458a50903b348ad9b2c4b4cca71927008484f75b781fb9cb","observation_id":"a59c1b95-db6d-49fd-b702-dba9feb0bc97","resolution":{"observed_at":"2026-08-15T20:12:38.650212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.632000Z","title":"Medioni, Isaac Cohen, Fran c ois Br \\' e mond, Somboon Hongeng, and Ramakant Nevatia","venue":null,"work_id":"17a5d0b1-f8bc-4ee2-8977-0cfb71e41388","year":2001},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.778258Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:a0ded543135ddc00c389264cee3f5c75eb63ef931d659bdcfafc20fd3422af26","observation_id":"3423089d-d6fc-48d0-a420-25ebbf955fa8","resolution":{"observed_at":"2026-08-15T20:12:38.637374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.619473Z","title":"Formal methods to comply with rules of the road in autonomous driving: State of the art and grand challenges","venue":null,"work_id":"a7aa5908-110e-4d60-9552-20fae4e5b4c9","year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.782221Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:1a485747d8446b37f122bb1aa015e45f79e71bc70ac56026e70b144211c8c97a","observation_id":"0bf424f4-1809-4da7-b4f2-bfce4cccd102","resolution":{"observed_at":"2026-08-15T20:12:38.623587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.606502Z","title":"8 must-follow social listening trends for 2025, January 2025","venue":null,"work_id":"936f627f-892c-45aa-818f-7e683d001756","year":2025},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.786453Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:622b9e1798ab9b164db114047ba1b2313eae91955e2acd035c612a61bc5559ae","observation_id":"4f7d6e52-cc40-4282-be7b-4d799373607b","resolution":{"observed_at":"2026-08-15T20:12:38.610632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.592757Z","title":"Learning audio-video modalities from image captions","venue":null,"work_id":"e09dd239-1284-49d0-9bcd-b66996d2b38b","year":2022},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.789977Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:646d35bfcd442c1bc7f62fae2adf2438e4c8225ef62a237b6fb1004a9707176e","observation_id":"8d32f684-f89d-43a9-ac55-5f4ff25a60f7","resolution":{"observed_at":"2026-08-15T20:12:38.597969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.576948Z","title":"Federal motor vehicle safety standards; automatic emergency braking systems for light vehicles","venue":null,"work_id":"c9a38e78-fbc9-4c95-94bd-c8dc3a0ad394","year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.794335Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:a08d57308b9681cec8f515e731d58328da42420552d9f378df1f35341954b3eb","observation_id":"00895aae-9a46-4c63-bb57-0e619cff48cf","resolution":{"observed_at":"2026-08-15T20:12:38.582430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T20:12:37.797834Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.797834Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:cbc8f86c49f41b22fcb9ea59a90821a958d64fc82bef52eac4248397e7cd6792","observation_id":"12bb363c-e1fd-4cde-997f-bebe1db94f8e","resolution":{"observed_at":"2026-08-15T20:12:37.797834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.563136Z","title":"Video generation models as world simulators, 2024","venue":null,"work_id":"dfabc6ca-0383-4a05-a68c-7c3a30555bed","year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.801936Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:4a608ef2e0f78492378b6f4ded6c3f98dd271c2c046aede87197281666248a0a","observation_id":"cda27a41-ce49-4ecb-bfe6-5a9dd190e11f","resolution":{"observed_at":"2026-08-15T20:12:38.568461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15334","last_updated":"2023-05-24T16:48:11Z","snapshot_observed_at":"2026-08-14T14:07:14.900729Z","submitted_at":"2023-05-24T16:48:11Z","title":"Gorilla: Large Language Model Connected with Massive APIs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15334","snapshot_observed_at":"2026-08-15T20:12:37.806971Z","title":"Patil, Tianjun Zhang, Xin Wang, and Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.806971Z"},"links":{"cited_paper":"/paper/2305.15334","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:f64ad8e537b7965465f7e05fea6b87ea27a1fc209f56fb348fdd504d138fc511","observation_id":"6e63a228-7da0-4400-b57e-6d8210ccbae3","resolution":{"observed_at":"2026-08-15T20:12:37.806971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:37.811659Z","title":"Toolllm: Facilitating large language models to master 16000+ real-world apis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.811659Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:08636ad01db810aaf5b555dbf6c5a1033dd5bc59f798169c93be1d032ccac672","observation_id":"733bf8e6-fa5a-423a-a37e-8a52d352a409","resolution":{"observed_at":"2026-08-15T20:12:37.811659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.542940Z","title":"Rapidapi hub","venue":null,"work_id":"9f4fe1d4-73b9-4cda-888e-184992eef8a8","year":2025},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.815835Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:7009cf1add671c4e15a891bdc807f9e873bb5eb665a83891812b474f4362b60b","observation_id":"59ab042d-7e39-4940-ae2b-4dbc2a09597a","resolution":{"observed_at":"2026-08-15T20:12:38.546900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.529575Z","title":"Introducing gen-3 alpha: A new frontier for video generation, 2024","venue":null,"work_id":"e76e0de0-cf2f-41c8-bd87-a99ea555e2f3","year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.819404Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:ee32cf15b85e2c5fff12e585ee4bf5200d17f2fd81098af954625bc63b9f3611","observation_id":"15021405-cc0f-485b-805f-2e4339d76eff","resolution":{"observed_at":"2026-08-15T20:12:38.534683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.518247Z","title":"Early detection of combustion instability by neural-symbolic analysis on hi-speed video","venue":null,"work_id":"ac6f07d4-9e6e-4ac1-9898-deb016cfef63","year":2015},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.822935Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:013c6c7cc628710c96b3c9063123981f0ea562a143ad019c9a0f1c9c39b90f2d","observation_id":"9581fbea-01b9-458a-ad3e-b2384b5c4265","resolution":{"observed_at":"2026-08-15T20:12:38.522525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16718","last_updated":"2025-04-25T02:50:58Z","snapshot_observed_at":"2026-08-14T11:06:32.480064Z","submitted_at":"2024-11-22T23:59:12Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","version":5},"cited_work":{"arxiv_id":"2411.16718","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.16718","snapshot_observed_at":"2026-08-15T20:12:38.094834Z","title":"Neuro-Symbolic Evaluation of Text-to-Video Models using Formal Verification","venue":"cs.CV","work_id":"cd2d78d6-657b-42e5-9d39-c0580899ba11","year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.827131Z"},"links":{"cited_paper":"/paper/2411.16718","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:d9e55dfd1431b81685a765aea2b0f6b2322655c627c967135b9048446044c8e8","observation_id":"03be9951-6b02-4ba4-b82c-30f37c80e96b","resolution":{"observed_at":"2026-08-15T20:12:38.101767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.505460Z","title":"Linear temporal logic motion planning for teams of underactuated robots using satisfiability modulo convex programming","venue":null,"work_id":"5881367b-5927-4936-8afa-6210fabb36a5","year":2017},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.830959Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:764ef9c763461e286102ed045ab650bffe78d43899ad367298bdca8a84f8148d","observation_id":"d91204f2-d990-4edd-816d-cc5a803fe063","resolution":{"observed_at":"2026-08-15T20:12:38.509704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.493447Z","title":"Shultz and Richard D","venue":null,"work_id":"903853e7-9d33-49fe-8ce0-618a99a6a499","year":2020},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.834603Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:9eecc2a9cb8587be98c068432ac513d105dbe03d748881ab6ddf6a84ac2cf309","observation_id":"4f4b3b50-f84e-40d4-a588-6f95915a78aa","resolution":{"observed_at":"2026-08-15T20:12:38.497389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10076","last_updated":"2025-02-09T05:57:42Z","snapshot_observed_at":"2026-08-15T20:56:05.956254Z","submitted_at":"2024-10-14T01:39:56Z","title":"VideoAgent: Self-Improving Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10076","snapshot_observed_at":"2026-08-15T20:12:37.838575Z","title":"Videoagent: Self-improving video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.838575Z"},"links":{"cited_paper":"/paper/2410.10076","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:ed8f1e1af21d685185c40c72a17d09c65273d739918d66850de6583a630d7c9b","observation_id":"e423d689-7017-4bce-a6ee-1baa6651bd2a","resolution":{"observed_at":"2026-08-15T20:12:37.838575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.481631Z","title":"Scalability in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":"4d252ed0-077c-4792-b0db-5722e0161984","year":2020},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.843630Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:4706e8652f2f6334972234c3e40937a5cd69cdbfe2b4263c168b5fb7d46d9246","observation_id":"112858a6-bb3b-4076-8e75-be239a51a244","resolution":{"observed_at":"2026-08-15T20:12:38.485727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T20:12:37.847534Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.847534Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:80977ccf3b70110549d3688a680acb6e94bc39e687d437126ffb4adf32528659","observation_id":"358a5ee7-c886-4bf2-a34c-7676c203f0ba","resolution":{"observed_at":"2026-08-15T20:12:37.847534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T20:12:37.851578Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.851578Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:1310f27250a9b9cb2cb4756555891659ce2d02156629e767cf615dd263a437d7","observation_id":"907d582c-7805-4444-8023-bc218adb79cd","resolution":{"observed_at":"2026-08-15T20:12:37.851578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.468715Z","title":"Video classification with channel-separated convolutional networks","venue":null,"work_id":"5ee216a0-bd6a-442f-8833-e932236cb35e","year":2019},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.855757Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:25806fae8995b03000098b6541c320cba45e99cea6cdce52e5f81962a6334893","observation_id":"2d9b4d22-5926-4e9f-9397-a2d0c1a00ac1","resolution":{"observed_at":"2026-08-15T20:12:38.473731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.455798Z","title":"Twilio: Cloud communications platform, 2025","venue":null,"work_id":"f9167ff6-def2-417d-9e52-05ce7199d653","year":2025},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.859602Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:92b5e7ba82de35e9d3289c625d7dcb66729174bcf343bc1a75abaa3d04a6b1fd","observation_id":"cb95453b-dea5-4942-b1d3-40dfeabc63af","resolution":{"observed_at":"2026-08-15T20:12:38.460428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02399","last_updated":"2022-10-05T17:18:28Z","snapshot_observed_at":"2026-08-15T13:11:17.068630Z","submitted_at":"2022-10-05T17:18:28Z","title":"Phenaki: Variable Length Video Generation From Open Domain Textual Description","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02399","snapshot_observed_at":"2026-08-15T20:12:37.863553Z","title":"Phenaki: Variable length video generation from open domain textual description","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.863553Z"},"links":{"cited_paper":"/paper/2210.02399","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:b1a4d14ff2b67bafd6116e4dea9effe5885e91f6ca08775d1371728713fbec97","observation_id":"3e8ddd96-625e-4479-9c75-e9d041c65650","resolution":{"observed_at":"2026-08-15T20:12:37.863553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.443608Z","title":"Lave: Llm-powered agent assistance and language augmentation for video editing","venue":null,"work_id":"5f92316c-c030-44ac-a3ba-d698e25ae68e","year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.868061Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:762f0a3eb4a6504726d12494633ac0cdc854e72b41e23985a98f6facfb8faa32","observation_id":"514fada2-65fe-4e86-934b-60dffde979c4","resolution":{"observed_at":"2026-08-15T20:12:38.447832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.429851Z","title":"Videoagent: Long-form video understanding with large language model as agent","venue":null,"work_id":"af1e6c3f-6cbf-4a06-8bca-1c605edbf923","year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.872219Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:6aa24b074f62f72bc7069d25ce151553332ecfb898641986fab6aec9acb8ef8b","observation_id":"e5fffafe-c83f-4919-ad93-5698cd2fc9b0","resolution":{"observed_at":"2026-08-15T20:12:38.434916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06942","snapshot_observed_at":"2026-08-15T20:12:37.876207Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.876207Z"},"links":{"cited_paper":"/paper/2307.06942","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:f19f30652a85ef77ebea4b487be1dbdb8d6d7b445aa978e1426a6efad520d5af","observation_id":"a314f256-c948-471a-81b8-34c797c3002d","resolution":{"observed_at":"2026-08-15T20:12:37.876207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.417072Z","title":"Discovqa: Temporal distortion-content transformers for video quality assessment","venue":null,"work_id":"a5825236-fe69-4793-8210-192d7599dfcb","year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.880887Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:e49acd2bc6791f9863a8132bd8658acc0916c98fa8dd1bd5c85372bc7517f0e5","observation_id":"0dd12723-69b4-407d-8032-fcf61d90973d","resolution":{"observed_at":"2026-08-15T20:12:38.421781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.402615Z","title":"Exploring video quality assessment on user generated contents from aesthetic and technical perspectives","venue":null,"work_id":"f83bef7c-3e85-47d0-9ef1-ddfb6e780ff7","year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.890455Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:531310023c6884cf53172d03da4073f4ce36485dbc7bd326a13594048edce036","observation_id":"f1711f3a-f577-461d-853a-92bae6e38ed1","resolution":{"observed_at":"2026-08-15T20:12:38.408757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.387488Z","title":"A graph-based framework to bridge movies and synopses","venue":null,"work_id":"a1a5a5f9-c195-429c-9ef7-fa883d243f98","year":2019},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.895422Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:76edd26d2d3419a82404d9be49ce6b9dced634ac354cecec2853c8e1dba88900","observation_id":"94821730-d236-48d2-b876-4f1f0e4b04b3","resolution":{"observed_at":"2026-08-15T20:12:38.392378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:37.899906Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.899906Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:020638a8ec28c1d43ba612dd2549ade4ccd6f825630af9d2fea85379af88f310","observation_id":"f6951e0d-5ee5-407f-b184-b3c3ac23eb14","resolution":{"observed_at":"2026-08-15T20:12:37.899906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.365974Z","title":"Hauptmann","venue":null,"work_id":"5c080cdb-c227-4acc-a5c8-b886505fdcc2","year":2015},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.903671Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:992c59d4204d85e302dbad2b1aa05c6614e95c36e3ee9da0c66763a22f5d56a1","observation_id":"aac87d70-054d-4842-839b-9054d1c40561","resolution":{"observed_at":"2026-08-15T20:12:38.370660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10171","last_updated":"2023-09-18T21:40:08Z","snapshot_observed_at":"2026-08-13T10:10:29.002953Z","submitted_at":"2023-09-18T21:40:08Z","title":"Specification-Driven Video Search via Foundation Models and Formal Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10171","snapshot_observed_at":"2026-08-15T20:12:37.907486Z","title":"Specification-driven video search via foundation models and formal verification","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.907486Z"},"links":{"cited_paper":"/paper/2309.10171","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:75e1b6e60aa3c7fe2a1259c608156a9b9fbc3e04ff596a7d1ff5d5ed6611b675","observation_id":"75b9bfce-61d0-4dde-86ec-cac5cf08f154","resolution":{"observed_at":"2026-08-15T20:12:37.907486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-15T20:12:37.911855Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.911855Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:bd311383ac9fd2873f40752291add46e91f524dbe63c2d03dd23c3252083a602","observation_id":"606c09b5-9861-4122-9d55-163c5dfabbf2","resolution":{"observed_at":"2026-08-15T20:12:37.911855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:37.916529Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.916529Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:aa2e0e53ccd92d6a3b68a2f364fcbad8ecd88e4af96f1768212cfa926194a5c3","observation_id":"ee854281-90a0-4b39-964b-60e5e8eef2b3","resolution":{"observed_at":"2026-08-15T20:12:37.916529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.343339Z","title":"Neural-symbolic VQA: disentangling reasoning from vision and language understanding","venue":null,"work_id":"a9707bbc-a028-49d8-b9d2-ee43a82d13f3","year":2018},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.920569Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:dd47b021b26f37425060abe7de946e2fbe09fdba95627228494ca9dfc31067dd","observation_id":"e208524f-70b6-4513-b00a-b63f287e9a97","resolution":{"observed_at":"2026-08-15T20:12:38.347806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.330059Z","title":"A probabilistic graphical model based on neural-symbolic reasoning for visual relationship detection","venue":null,"work_id":"d3bd55bc-7da2-442f-9f61-9ce0fff71804","year":2022},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.924353Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:9498ba849f2e97092b542d0b4e06991096806cdd403264d50d457b0c7ea702a6","observation_id":"30c2dae2-e768-49f9-87b2-c7c9314d5eab","resolution":{"observed_at":"2026-08-15T20:12:38.334377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-15T20:12:37.928130Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.928130Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:dd82b79ed9a38f0bfed88260b2d897df1416e74e74aeba01a9d9518e06db8faf","observation_id":"ee7345f8-4105-46e6-a41e-11b703efe8b8","resolution":{"observed_at":"2026-08-15T20:12:37.928130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-15T20:12:37.931752Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.931752Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:a294f0f24a8d739f07f8a1d8907acfd17a5d01436e83d6ca420504b2bba18677","observation_id":"787a5d85-77ac-482f-b443-ed0e42b9169a","resolution":{"observed_at":"2026-08-15T20:12:37.931752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:12:38.317234Z","title":"Abnormal event detection by a weakly supervised temporal attention network","venue":null,"work_id":"a3612213-e977-4a7a-acf9-d1e6c66b14ae","year":2022},"citing_paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T20:12:37.935546Z"},"links":{"citing_paper":"/paper/2505.13851"},"observation_digest":"sha256:fb5f808ec7242dd0c14d5b2a62768a39c60e8b34a20d884a6b79edc7fb38d8e4","observation_id":"276b431e-0376-4591-973d-015d548758e9","resolution":{"observed_at":"2026-08-15T20:12:38.321696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.13851","last_updated":"2025-05-20T02:53:21Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T20:06:41.402103Z","submitted_at":"2025-05-20T02:53:21Z","title":"A Challenge to Build Neuro-Symbolic Video Agents"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":2,"verified_fuzzy":42},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 2 inbound Pith citation observations for arXiv:2505.13851."}