{"as_of":"2026-08-04T20:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:52737bfa92cd870596d50363a3e21f1eb71684ed1fb2ece0876dffe587179d48","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T02:13:12.723564Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.25537/citation-record","integrity":"/paper/2607.25537/integrity","json":"/paper/2607.25537/citation-record.json","paper":"/paper/2607.25537"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.14024","last_updated":"2023-01-23T17:00:01Z","snapshot_observed_at":"2026-07-06T14:35:37.368351Z","submitted_at":"2022-12-28T18:52:44Z","title":"Demonstrate-Search-Predict: Composing retrieval and language models for knowledge-intensive NLP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.14024","snapshot_observed_at":"2026-08-01T02:13:11.448951Z","title":"Demonstrate-search-predict: Composing retrieval and language models for knowledge-intensive NLP.arXiv preprint arXiv:2212.14024, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:11.448951Z"},"links":{"cited_paper":"/paper/2212.14024","citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:2939452a43e9a7039964f7a4b464bac4e92242b8de2bd78aa810cdc7db1049f8","observation_id":"5f090e9a-fe50-4d4c-94f5-f60cc954ff98","resolution":{"observed_at":"2026-08-01T02:13:11.448951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11382","last_updated":"2023-02-21T12:42:44Z","snapshot_observed_at":"2026-07-06T14:54:37.559648Z","submitted_at":"2023-02-21T12:42:44Z","title":"A Prompt Pattern Catalog to Enhance Prompt Engineering with ChatGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11382","snapshot_observed_at":"2026-08-01T02:13:11.462591Z","title":"A prompt pattern catalog to enhance prompt engineering with ChatGPT.arXiv preprint arXiv:2302.11382, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:11.462591Z"},"links":{"cited_paper":"/paper/2302.11382","citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:f4942757fb0f44a63e89a30808bda199d1a42d2e7b43a4ac79eaefe86f49ac61","observation_id":"09c09a26-2eb7-4188-a66e-f7914423a6b8","resolution":{"observed_at":"2026-08-01T02:13:11.462591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:11.479275Z","title":"Prompt engineering with ChatGPT: a guide for academic writers.Annals of biomedical engineering, 51(12):2629–2633, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:11.479275Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:68668e4e1786a79d802198cb5cbaea36c8c01eb67a63fb30d1f0e09148fcfbbe","observation_id":"89a7b524-47c3-4ab3-b752-0fecacec8c1f","resolution":{"observed_at":"2026-08-01T02:13:11.479275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:11.490979Z","title":"Prompt programming for large language models: Beyond the few-shot paradigm","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:11.490979Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:8dfe80a15a2af8eaf515848ab038dacca5c6ffcc6a1a98b9b82388df445b2f90","observation_id":"d5eedd9b-796c-43da-bdf3-c67c584abc2f","resolution":{"observed_at":"2026-08-01T02:13:11.490979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:11.507043Z","title":"Dspy: compiling declarative language model calls into state-of-the-art pipelines","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:11.507043Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:a309242b9b64cb94e68bd824209773f55aeba6186f6594970fbea4b57a75aa0d","observation_id":"744a43c0-473a-478e-a94a-3098827c6b5e","resolution":{"observed_at":"2026-08-01T02:13:11.507043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07496","last_updated":"2024-06-11T17:32:21Z","snapshot_observed_at":"2026-07-06T18:29:04.294349Z","submitted_at":"2024-06-11T17:32:21Z","title":"TextGrad: Automatic \"Differentiation\" via Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07496","snapshot_observed_at":"2026-08-01T02:13:11.524453Z","title":"Textgrad: Automatic differentiation via text.arXiv preprint arXiv:2406.07496, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:11.524453Z"},"links":{"cited_paper":"/paper/2406.07496","citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:03b5969accef06025cf81fca3309a016967aba4f799130f0073578bf2b4c82a0","observation_id":"bee71271-569c-4350-b0be-ca4ba20dbfa9","resolution":{"observed_at":"2026-08-01T02:13:11.524453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:11.540171Z","title":"Prompt engineering in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:11.540171Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:caec46c6945e434bfce4e80ed15827110cdf31bc78a8f5860ce4f64925867173","observation_id":"ebe7cd9b-39d2-4f59-9b08-de03a11b14a2","resolution":{"observed_at":"2026-08-01T02:13:11.540171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:11.561565Z","title":"Prompt engineering as an important emerging skill for medical professionals: tutorial.Journal of medical Internet research, 25:e50638, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:11.561565Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:b9780fc6b0ce06171c23b82b4c9966859948a39f01c04594c1f7e60ceba89a2f","observation_id":"b0a38dd5-468c-4434-bfe6-c0d6a8719c8d","resolution":{"observed_at":"2026-08-01T02:13:11.561565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20328","last_updated":"2025-09-29T20:44:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T17:17:27Z","title":"Video models are zero-shot learners and reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.20328","snapshot_observed_at":"2026-08-01T02:13:11.573564Z","title":"Video models are zero-shot learners and reasoners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:11.573564Z"},"links":{"cited_paper":"/paper/2509.20328","citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:2f4db488b27db6169814f9ab0030a7de4590ae2538c572473ed4fbf42bdef3da","observation_id":"0654ae9d-0209-4ca9-b583-f60db8edc336","resolution":{"observed_at":"2026-08-01T02:13:11.573564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17139","last_updated":"2024-02-27T02:05:29Z","snapshot_observed_at":"2026-08-04T02:50:42.922408Z","submitted_at":"2024-02-27T02:05:29Z","title":"Video as the New Language for Real-World Decision Making","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17139","snapshot_observed_at":"2026-08-01T02:13:11.587979Z","title":"Video as the new language for real-world decision making.arXiv preprint arXiv:2402.17139, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:11.587979Z"},"links":{"cited_paper":"/paper/2402.17139","citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:2ff060a04d27086197e6e300ece28cb2a04236f00655d156c95ab72c2fc091b5","observation_id":"a8759541-caa2-4281-a86f-58fc7310dc89","resolution":{"observed_at":"2026-08-01T02:13:11.587979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:11.632251Z","title":"Rethinking visual intelligence: Insights from video pretraining.arXiv preprint arXiv:2510.24448, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:11.632251Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:0e4ab089afdc954047c62b769ea64aea004779b056054e351cce875608ef5aa4","observation_id":"d062959b-d2a0-4e0b-8cd5-74fecac58800","resolution":{"observed_at":"2026-08-01T02:13:11.632251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:11.677056Z","title":"A very big video reasoning suite.arXiv preprint arXiv:2602.20159, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:11.677056Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:b3c5eaa680bdb0cfc4521d15db3cb869f342ccacc284becdca65778e8d4364e4","observation_id":"f48ddc45-34d6-46fe-9b10-ff51575dd041","resolution":{"observed_at":"2026-08-01T02:13:11.677056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02465","last_updated":"2026-06-10T12:52:04Z","snapshot_observed_at":"2026-08-03T05:23:28.259581Z","submitted_at":"2026-02-02T18:49:06Z","title":"MentisOculi: Revealing the Limits of Reasoning with Mental Imagery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02465","snapshot_observed_at":"2026-08-01T02:13:11.701130Z","title":"MENTISOCULI: Revealing the limits of reasoning with mental imagery.arXiv preprint arXiv:2602.02465, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:11.701130Z"},"links":{"cited_paper":"/paper/2602.02465","citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:a6cd9b43c2b6ffd3247f61ce6be2c302051b2cea7ce5dc22923d806b91b00da6","observation_id":"b40ca782-8d73-490d-826a-4cd7ac835f78","resolution":{"observed_at":"2026-08-01T02:13:11.701130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:11.730294Z","title":"Video models reason early: Exploiting plan commitment for maze solving.arXiv preprint arXiv:2603.30043, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:11.730294Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:1cbd6c4143c9ca6f57f3b15f8e744162b4bb4a88b64cf5c97a83fbad96387a14","observation_id":"22e635c4-1d8e-417e-99d7-c1a8bc7657b1","resolution":{"observed_at":"2026-08-01T02:13:11.730294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:11.741999Z","title":"Are video models ready as zero-shot reasoners? an empirical study with the mme-cof benchmark","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:11.741999Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:29efb9872322363ede4ddbd09a081ccffa6f9b5a806101fe4dea3b51fffc5be2","observation_id":"1ddbc3ed-f6a2-4f2e-b577-cb97588e1911","resolution":{"observed_at":"2026-08-01T02:13:11.741999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16870","last_updated":"2026-07-31T08:55:01Z","snapshot_observed_at":"2026-08-04T20:09:46.123480Z","submitted_at":"2026-03-17T17:59:55Z","title":"Demystifying Video Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16870","snapshot_observed_at":"2026-08-01T02:13:11.772187Z","title":"Demystifying video reasoning.arXiv preprint arXiv:2603.16870, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:11.772187Z"},"links":{"cited_paper":"/paper/2603.16870","citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:147f73099e0909da0c36f2b048fd31a810836506869ad764023d394535a92843","observation_id":"a1e35699-3f7b-4289-b025-7f4af4bed506","resolution":{"observed_at":"2026-08-01T02:13:11.772187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:11.894883Z","title":"Thinking in frames: How visual context and test-time scaling empower video reasoning.arXiv preprint arXiv:2601.21037, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:11.894883Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:aaa8ac3b6400db7880fa8062a59261b6836a42f85cabc56453887d9b90131f23","observation_id":"80735478-d855-4326-a579-d2a52006468a","resolution":{"observed_at":"2026-08-01T02:13:11.894883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02564","last_updated":"2026-06-27T07:03:15Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:54:26Z","title":"VLMs are Good Teachers for Video Reasoning via Adaptive Test-Time Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02564","snapshot_observed_at":"2026-08-01T02:13:11.938873Z","title":"VLMs are good teachers for video reasoning via adaptive test-time optimization.arXiv preprint arXiv:2606.02564, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:11.938873Z"},"links":{"cited_paper":"/paper/2606.02564","citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:f8da682f407c5e045b58bdad211007bd8971c71f7dc70cb605f4daaae3d3a937","observation_id":"0668deb4-1aad-42da-b63c-07be808d368b","resolution":{"observed_at":"2026-08-01T02:13:11.938873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.013390Z","title":"Thinking with video: Video generation as a promising multimodal reasoning paradigm","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.013390Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:4109f62598681d68c68cc2a96837f1eb3cfdc7e8e0ed1efb93df61e7cea59346","observation_id":"bd531f51-11e3-419b-9ecd-d8ddce809eba","resolution":{"observed_at":"2026-08-01T02:13:12.013390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.146963Z","title":"Review of large vision models and visual prompt engineering.Meta-Radiology, 1(3):100047, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.146963Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:8b79dd75ad1fc9bc7be96106dce5aac631162e8386b3b1b647345a05ece4f446","observation_id":"e3435844-0e9a-4b6a-b693-41c87750df24","resolution":{"observed_at":"2026-08-01T02:13:12.146963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12980","last_updated":"2023-07-24T17:58:06Z","snapshot_observed_at":"2026-07-31T11:07:41.486136Z","submitted_at":"2023-07-24T17:58:06Z","title":"A Systematic Survey of Prompt Engineering on Vision-Language Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12980","snapshot_observed_at":"2026-08-01T02:13:12.198478Z","title":"A systematic survey of prompt engineering on vision-language foundation models.arXiv preprint arXiv:2307.12980, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.198478Z"},"links":{"cited_paper":"/paper/2307.12980","citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:882338b1637a1aaa2b432a15b05ef02f85303feeea3dc993af666796f5c057d0","observation_id":"b7cda6a1-eada-4c41-8416-e152951f0bc6","resolution":{"observed_at":"2026-08-01T02:13:12.198478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.253737Z","title":"What does clip know about a red circle? visual prompt engineering for vlms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.253737Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:f9813763814ec251ee26b8caf9ccb6968c983bce31646a90d5242f19a0d5abc5","observation_id":"0cd51713-ca86-417a-abe8-98a1a2fa6d14","resolution":{"observed_at":"2026-08-01T02:13:12.253737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.300836Z","title":"Cpt: Colorful prompt tuning for pre-trained vision-language models.AI Open, 5:30–38, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.300836Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:268c7f2122627b63c18d32de51dcbcfaeb0082a28d507c704213f711fa61dd0e","observation_id":"2d743149-ad87-428e-a26b-16dbbce48e60","resolution":{"observed_at":"2026-08-01T02:13:12.300836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17274","last_updated":"2022-06-03T17:52:04Z","snapshot_observed_at":"2026-07-06T12:55:27.843060Z","submitted_at":"2022-03-31T17:59:30Z","title":"Exploring Visual Prompts for Adapting Large-Scale Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17274","snapshot_observed_at":"2026-08-01T02:13:12.362932Z","title":"Exploring visual prompts for adapting large-scale models.arXiv preprint arXiv:2203.17274, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.362932Z"},"links":{"cited_paper":"/paper/2203.17274","citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:f0cf1f4047865aca7659ba2a40eee4c9b117639dded25e4c5750967b20a94da8","observation_id":"085e645b-ba73-4dbc-98ac-2d97d35e2bfc","resolution":{"observed_at":"2026-08-01T02:13:12.362932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.425127Z","title":"Highlight: Learning visual prompts for vision-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.425127Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:003c1d0c110df6bf51a0547ddade1be67c1c90f9fa2cf84207cd23577d3e5950","observation_id":"3070168c-54c1-4a00-9076-42c423b9a614","resolution":{"observed_at":"2026-08-01T02:13:12.425127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.495284Z","title":"Visual prompt tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.495284Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:5f3e92a50818a4ff348302d4b0d5182c540aac7852840c5914c9c8b64b679a00","observation_id":"f20ac7b9-241a-433e-869a-2982d5afeb3c","resolution":{"observed_at":"2026-08-01T02:13:12.495284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.562064Z","title":"Visual promptingviaimageinpainting","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.562064Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:69230c631c6d81b18a75094cafc2c3e28ee04b8301cb3d91474852bf187da24f","observation_id":"54a50607-9700-44b8-85bc-541c0487cc3f","resolution":{"observed_at":"2026-08-01T02:13:12.562064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.575509Z","title":"Images speak in images: A generalist painter for in-context visual learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.575509Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:4c01adafcc0bb4ffdac3d244a3f80c9feb8e47db06128bd927d071d582875b12","observation_id":"345bc233-e3ed-46bd-bfe9-e89dfc631b4f","resolution":{"observed_at":"2026-08-01T02:13:12.575509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.579748Z","title":"Visualcloze: A universal image generation framework via visual in-context learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.579748Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:2615ff99a234bcae930290754074bf36dd94077d88efbe842aa93b6c213be87b","observation_id":"a64133c8-05fe-46d5-80fd-e478ce72cf3b","resolution":{"observed_at":"2026-08-01T02:13:12.579748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.583911Z","title":"Draw-and-understand: Leveraging visual prompts to enable mllms to comprehend what you want","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.583911Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:f47b2c682a5111e6497eb69195a71cd5b13644e634990b56ac357107e074b162","observation_id":"4c4ec16f-038e-440b-8c90-77973ef24ef5","resolution":{"observed_at":"2026-08-01T02:13:12.583911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.588062Z","title":"Visual Physics Comprehension Test (VPCT) Dataset.https://huggingface","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.588062Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:e3fa79907e544fdb52943442705015db9c236809e683f501700fbbd7ca03a8bb","observation_id":"a38f6da9-6952-4955-bd88-71f4f76b3eff","resolution":{"observed_at":"2026-08-01T02:13:12.588062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.592298Z","title":"Nano Banana 2: Gemini Image Generation Overview.https://gemini.google/ov erview/image-generation/, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.592298Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:c7383c1fe438f8d3d5997e0f95ede089724f3eec57f2b88a82806a472c9b1b74","observation_id":"5a03b69f-f3fb-40bf-8a81-95d7e64f3319","resolution":{"observed_at":"2026-08-01T02:13:12.592298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.596436Z","title":"Gemini 3.1 Pro","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.596436Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:8a3561357c0ed8564be64e7804880095637d3e6d29aa14fd96be3657ae75933d","observation_id":"61c54c8f-14b9-47a8-8e17-518fb2d2cc1c","resolution":{"observed_at":"2026-08-01T02:13:12.596436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-01T02:13:12.600739Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.600739Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:e6904972bd7bf09cd2ce44766c1b8e45035b74db727e8fa12f74fd5ff4e8c608","observation_id":"589565e5-19eb-431f-a5b4-421644604b78","resolution":{"observed_at":"2026-08-01T02:13:12.600739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.605421Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.605421Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:7ae0751aa71bff97c22dde5ff45e950aca804e3f1bd638e43b999d6ede632cd8","observation_id":"ec29296a-05f9-4d7d-954a-5385078ca917","resolution":{"observed_at":"2026-08-01T02:13:12.605421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.609889Z","title":"Omni Flash Model Card.https://deepmind.google/models/model-cards/g emini-omni-flash/, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.609889Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:2de3b7bdc8de94269d0ffafb36053ef3705f3eea243b29b78c2e58a85e1ccce1","observation_id":"a2921345-95d1-4bca-b538-6fe676ddc70f","resolution":{"observed_at":"2026-08-01T02:13:12.609889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.614086Z","title":"Interpreting and controlling model behavior via constitutions for atomic concept edits","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.614086Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:2ff6888fb4a3f5ded77a76d7af18b3c7cd855e7cbe777cca46a753f606bcf1f1","observation_id":"58327f99-3e6a-4d34-a34f-99a46d33de5c","resolution":{"observed_at":"2026-08-01T02:13:12.614086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-01T02:13:12.618377Z","title":"Self-consistency improves chain of thought reasoning in language models.arXiv preprint arXiv:2203.11171, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.618377Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:380e82959e324c46fbe2d827dc5481edbc553a4951bf49924270f6348b75f6f5","observation_id":"843dabc7-1838-4840-8831-6ec344419360","resolution":{"observed_at":"2026-08-01T02:13:12.618377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.622700Z","title":"Gemini developer API pricing.https://ai.google.dev/gemini-api/docs/pr icing#veo-3.1, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.622700Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:fbce3e43e893935eda6f61ef654c86f3e2738bf71265afc95acf59bc1c7a3f1a","observation_id":"cc6a05d0-6c30-4c7f-8176-41394e174f2b","resolution":{"observed_at":"2026-08-01T02:13:12.622700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.626805Z","title":"Performance vs","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.626805Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:2765ffb7f8390ba4387ca4f7b1426cfcd90793adfc7b0034cff7c645886d8e60","observation_id":"f69b5237-8b0e-463e-8ae0-e3291e97c427","resolution":{"observed_at":"2026-08-01T02:13:12.626805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.631186Z","title":"How can we know what language models know?Transactions of the Association for Computational Linguistics, 8:423–438, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.631186Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:3e93b9c0c5e8b33f8045eddac70eee625e1a61e6195626a72df2027e91f3406f","observation_id":"d65c511e-c7ab-4aa3-ac98-bd961710bf65","resolution":{"observed_at":"2026-08-01T02:13:12.631186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.635363Z","title":"Inducing relational knowledge from BERT","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.635363Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:95325157dee7094773bb8679e4b939f93d1b712391b0d2128079213af960673d","observation_id":"9e66877a-2c83-43d4-9e57-4047f3e4fe62","resolution":{"observed_at":"2026-08-01T02:13:12.635363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.639407Z","title":"Shortcut learning in deep neural networks.Nature Machine Intelligence, 2(11):665–673, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.639407Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:fb71c98c087d91f89a20de89e8e4c5744d9c10ce2eea4a5933300237c758dd54","observation_id":"40892ac7-8b43-41a3-91b1-ca301b55024b","resolution":{"observed_at":"2026-08-01T02:13:12.639407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.643831Z","title":"Unmasking Clever Hans predictors and assessing what machines really learn.Nature communications, 10(1):1096, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.643831Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:1768b7efb378eb263d4a0279ff9ca0242e7cec07577fce2450da868144bce01c","observation_id":"f7810ad5-54e8-48c9-914a-5599cbf52dd5","resolution":{"observed_at":"2026-08-01T02:13:12.643831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.648237Z","title":"Unbiased look at dataset bias","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.648237Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:ac9836312db79ca1c5152850a91b22c0aac07af0e4870842cfa42bed1769d74f","observation_id":"0fba6822-e52a-409b-8bdf-7093defd00d9","resolution":{"observed_at":"2026-08-01T02:13:12.648237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-08-01T02:13:12.652594Z","title":"Cosmos 3: Omnimodal world models for physical AI.arXiv preprint arXiv:2606.02800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.652594Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:86b55bb287c5670b9ad8714e8eba28e854108a7be47db1fe8d19ea01ea9b5cec","observation_id":"88035d6b-db89-4b45-b581-abb7c189b321","resolution":{"observed_at":"2026-08-01T02:13:12.652594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.656912Z","title":"this vertical drop leads directly into the first bucket on the left","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.656912Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:f4fe25e978d432c286358d6fb02213afb93b8e72d95a64784e9c0b6fac7ca54f","observation_id":"558e47f8-d117-4434-bee0-2a3ca4ee0768","resolution":{"observed_at":"2026-08-01T02:13:12.656912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.661963Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.661963Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:59c8148636e6ae7ef6df986f50b095d1554106dc74529e7b4673551d0c80056f","observation_id":"0ee5b61a-16dc-40fc-9423-fd5f1be4e28a","resolution":{"observed_at":"2026-08-01T02:13:12.661963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.666424Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.666424Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:2d2e046d1d19668c5d77173a6417c5bbef95c5e3d77d4b1f9005349f9dce649e","observation_id":"1814a3af-73f5-4c0a-9383-453be937d88a","resolution":{"observed_at":"2026-08-01T02:13:12.666424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.670666Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.670666Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:7913ea24281f54e0bc8092ac92ce4be68526990eb4a5a95715f21a8f8745ec0d","observation_id":"f6e5c226-f8c0-4a60-9e7f-e307a3cfdf3c","resolution":{"observed_at":"2026-08-01T02:13:12.670666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.674895Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.674895Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:e78def786c3286ee280bcb3430434ae363392e84b3d8e49dd8f4d8941cb9c3ba","observation_id":"2df7766c-1d9d-4856-8a91-229bcfb18784","resolution":{"observed_at":"2026-08-01T02:13:12.674895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.679494Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.679494Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:d6f21ec2e6d38b352c0f8c45fcb573bf260142e62cb7f28a1bb4e3cb94fc962d","observation_id":"003ff0e1-6050-4106-8dc5-2cc570bcba7c","resolution":{"observed_at":"2026-08-01T02:13:12.679494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.683907Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.683907Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:7b0854a93c517588d41c91cdace2aea3235c98b74157c65517f6d9cdb1f5af38","observation_id":"5e611fd3-90b4-45f2-a345-eaf0524a8e35","resolution":{"observed_at":"2026-08-01T02:13:12.683907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.688751Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.688751Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:2915da9937aa7abe135b9e4e7b2be36138666bfaed60d274e7452c518f6bcbd0","observation_id":"f5104bf3-1644-4950-9952-94d42ad2e31b","resolution":{"observed_at":"2026-08-01T02:13:12.688751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.692912Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.692912Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:8d6b1de5823da6dd8f179e9f7952be4411aad6944cbe3aa488a666bc82889c1c","observation_id":"09508719-b996-4a91-ab5c-ae012492def5","resolution":{"observed_at":"2026-08-01T02:13:12.692912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.696949Z","title":"Static shot, no zoom or pan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.696949Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:8470f7920f4d42838a598a06a852268c1ccab45269d35d0251a2a8f0e7a60b10","observation_id":"f6225924-a716-48ff-9187-a2c7911213a9","resolution":{"observed_at":"2026-08-01T02:13:12.696949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.702377Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.702377Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:ef10f7bda9a7a27e9be2cb7a790571269b5666ab9f9632dfe4301071648c27ca","observation_id":"da033842-a0c7-4868-b0ee-0e7477f01da3","resolution":{"observed_at":"2026-08-01T02:13:12.702377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.710844Z","title":"justification","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.710844Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:7f0a061abc28fa008125939fe41f5a6a238fefe4a57c0f881434a9eac7a50a24","observation_id":"7139350d-05e2-440a-8f02-301b721cfce4","resolution":{"observed_at":"2026-08-01T02:13:12.710844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.715433Z","title":"moves”: A list of strings representing the extracted moves in order, e.g., [“A N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.715433Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:dc36ebc5782926ede0f0711a736f3979c062b31bcc57a690af81e1f28a616c03","observation_id":"08a7fe50-9548-444a-b797-d6fdceb30cd2","resolution":{"observed_at":"2026-08-01T02:13:12.715433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.719328Z","title":"invalid_after_seconds","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.719328Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:a4e5417f5d603fa5b063df772ec9fb7ed40e0bb6fe93d9ef0de5fca7d6703b6c","observation_id":"b1c04840-bd69-40ac-adae-20f12b9cc66e","resolution":{"observed_at":"2026-08-01T02:13:12.719328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T02:13:12.723564Z","title":"justification","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T02:13:12.723564Z"},"links":{"citing_paper":"/paper/2607.25537"},"observation_digest":"sha256:3a9c8fbc16c14f75a6d4db4c149ebe7397a92ffd91c1e57c4e09ccb4a88565bd","observation_id":"94721f54-1154-44b3-ac2c-bda806b17fb9","resolution":{"observed_at":"2026-08-01T02:13:12.723564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.25537","last_updated":"2026-07-28T10:18:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T23:41:03.499460Z","submitted_at":"2026-07-28T10:18:58Z","title":"Visual prompt engineering for video models"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2607.25537."}