{"as_of":"2026-08-13T18:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d99204d45e7c94b787e5df7982c32ffdc6f0ab918020cea8dfdb04c10d910712","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:49:08.954450Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.11621/citation-record","integrity":"/paper/2412.11621/integrity","json":"/paper/2412.11621/citation-record.json","paper":"/paper/2412.11621"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.556521Z","title":null,"venue":null,"work_id":"062bd6bf-5af9-4eeb-85da-0e9d63b814b7","year":2016},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.771367Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:55139d142c31ca38b2dc49d712c0721441a4d64040aac9a76e43a85147a3420f","observation_id":"f3704557-7b7c-4f31-8cd6-39bd177236fd","resolution":{"observed_at":"2026-08-11T14:49:09.560441Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:08.775952Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.775952Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:ef263287290740b4d30ad6c5e41fe077edec1a0125e8b576f51f648a8e1289a7","observation_id":"335ed295-1e65-46e1-88cc-596fc51371fc","resolution":{"observed_at":"2026-08-11T14:49:08.775952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.532746Z","title":"W.; Fidler, S.; and Kreis, K","venue":null,"work_id":"7550a363-64a5-4304-b0c0-5be93f1eb98f","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.779774Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:19ce6b7b1bb8fbbec9c78174e8010b8b1c678bf1203249c1fd66b5f20359fc11","observation_id":"d53646f4-ed9d-48e2-9d1c-bd94b34e96ca","resolution":{"observed_at":"2026-08-11T14:49:09.536762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.521016Z","title":null,"venue":null,"work_id":"23bbc9a1-cca4-4937-a208-9607a525117a","year":2020},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.783638Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:06fd656fdc9fcbd570c7b184f03cd7540057daf42ad7adc98cbbcd39141afcae","observation_id":"fc4ce99e-b9b6-439a-bbf5-690cbf334087","resolution":{"observed_at":"2026-08-11T14:49:09.524899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.508779Z","title":null,"venue":null,"work_id":"3ebe09ce-e26b-42d1-8301-3b441d0317b2","year":2020},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.787366Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:577132bb54171a5330fee5c384282adae83f7aab9e76330f165c480cf45ad81c","observation_id":"69e13dbf-1d91-4e02-8842-ebf95ba1bfcf","resolution":{"observed_at":"2026-08-11T14:49:09.512793Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08769","last_updated":"2023-03-16T01:19:06Z","snapshot_observed_at":"2026-08-13T12:42:26.907427Z","submitted_at":"2023-02-17T23:25:57Z","title":"Prompting Large Language Models With the Socratic Method","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08769","snapshot_observed_at":"2026-08-11T14:49:08.791812Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.791812Z"},"links":{"cited_paper":"/paper/2303.08769","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:53ce42acf9d77c49c4f6d97adfa0eb2c78ef5b358d3916eb875144badb14c714","observation_id":"f0f099a0-f06a-4b87-accf-3b84683ab146","resolution":{"observed_at":"2026-08-11T14:49:08.791812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.498043Z","title":"M.; and Cardie, C","venue":null,"work_id":"36fdf8bc-b59b-45c7-bf55-dd1da5d98785","year":2021},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.796874Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:bd21933398626155fb0aa08939fd2f7a0c6152c6b5308d212799b5b74f927757","observation_id":"a090152c-e966-4ce8-8258-ab4665fec9f4","resolution":{"observed_at":"2026-08-11T14:49:09.501437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.487193Z","title":"G.; Wildes, R","venue":null,"work_id":"fe45eaaf-9735-4b37-a9ab-d87f43c27b74","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.800722Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:e0dc385dec3d443b1eded74464775e5b02f73cdcfbaf11cace4b81b3ac60ebe4","observation_id":"f6d5fc53-e486-42f4-8cf6-11c77dc60bc4","resolution":{"observed_at":"2026-08-11T14:49:09.490949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.476204Z","title":null,"venue":null,"work_id":"86515ad7-73c1-4ca0-bf05-7763b722fe81","year":2019},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.804970Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:7a52ab1f99fa726a272f54f9e6b820b282f7de837913ada144f1aa622cee57b5","observation_id":"42092e8e-5e8b-40ae-a81d-9e27fd1ec5f3","resolution":{"observed_at":"2026-08-11T14:49:09.479735Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07409","last_updated":"2023-09-14T03:25:37Z","snapshot_observed_at":"2026-08-13T10:14:00.856545Z","submitted_at":"2023-09-14T03:25:37Z","title":"Masked Diffusion with Task-awareness for Procedure Planning in Instructional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07409","snapshot_observed_at":"2026-08-11T14:49:08.808773Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.808773Z"},"links":{"cited_paper":"/paper/2309.07409","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:940894b2e4f523d4c92b74f0924cebfb453249dbe740d940d4b9547ea8ee7b7f","observation_id":"95726092-4085-4a18-8bf5-f65d9fe42131","resolution":{"observed_at":"2026-08-11T14:49:08.808773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.463830Z","title":null,"venue":null,"work_id":"4d4d0f46-1690-441f-a5fd-9edbc2ab7056","year":2022},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.813282Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:2691270a32237643172f1e6a538439f2fc8311ed2f4778d0f06c5cbaede1df6f","observation_id":"d32aa3d6-7551-4f38-b0ec-450175a8d828","resolution":{"observed_at":"2026-08-11T14:49:09.467848Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.449850Z","title":"F.; Song, C.; Chen, J.; Gao, D.; Lei, W.; Xu, Q.; Lim, J.; and Shou, M","venue":null,"work_id":"a351aad9-4548-43e8-a85a-9e6d39e94c9d","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.817561Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:c32b22dc2f50a2d7ce1bb4f44999ca296fe0d1860dfd844ddcd4e1c7280205c0","observation_id":"bbb01c25-d681-4ccf-b080-b6caf2b07682","resolution":{"observed_at":"2026-08-11T14:49:09.454996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T14:49:08.821527Z","title":"Q.; Sablayrolles, A.; Mensch, A.; Bamford, C.; Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.821527Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:98f1243620bb643e898a3404467415a907b89e92059c2a24d5f8c7252636af6e","observation_id":"149f6b9a-9f9f-42e0-b150-3b4cc7aab241","resolution":{"observed_at":"2026-08-11T14:49:08.821527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.434451Z","title":null,"venue":null,"work_id":"7bb193e4-61fa-4293-bd1c-381fc8f81c35","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.825759Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:0fdfe4f1dcfad11b4f47969ed5ff0aeb1b1cd9907ec0652edd288369f52f1709","observation_id":"04983b0e-a886-42a0-8d35-e1aeba6aec35","resolution":{"observed_at":"2026-08-11T14:49:09.439353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.420814Z","title":"S.; Reid, M.; Matsuo, Y.; and Iwasawa, Y","venue":null,"work_id":"968efbb3-dde4-40c4-be4a-6957aacbdaba","year":2022},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.829227Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:3fe6b54e0ea9a976ffd5c40608090c3121cb3a3ff701822f475fa6a659a5d76e","observation_id":"74f526f3-895a-4219-895c-7e73c1c056af","resolution":{"observed_at":"2026-08-11T14:49:09.424290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.409050Z","title":"B.; and Serre, T","venue":null,"work_id":"e4d2872c-87cf-47dd-9531-f3c69051e258","year":2014},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.832764Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:bb14cd2a49dfcf4a260d204fe982a641ce25f25f4ed8da6d9f0d9229a1eb514e","observation_id":"033db58e-43ba-42b5-9e20-57cec483aad4","resolution":{"observed_at":"2026-08-11T14:49:09.412834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.397019Z","title":null,"venue":null,"work_id":"ee3d730f-4752-445f-b76d-538abd6b866f","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.836447Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:56b5e0ead1811bf371aad79124bcdde3167b8bff970a08755bee45e0d621b7a4","observation_id":"c790b25b-f0cb-4854-9dfb-80459f26cf61","resolution":{"observed_at":"2026-08-11T14:49:09.400947Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17444","last_updated":"2024-05-04T19:28:10Z","snapshot_observed_at":"2026-08-13T10:01:55.605067Z","submitted_at":"2023-09-29T17:54:46Z","title":"LLM-grounded Video Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17444","snapshot_observed_at":"2026-08-11T14:49:08.840008Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.840008Z"},"links":{"cited_paper":"/paper/2309.17444","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:91b3f42bc04d15288aa64054a62d7acabc0415616cf83acd26f77d47a085c002","observation_id":"545c1ac0-e76b-4f31-9eb4-25ccb4cc5f66","resolution":{"observed_at":"2026-08-11T14:49:08.840008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15091","last_updated":"2024-07-12T18:03:29Z","snapshot_observed_at":"2026-08-13T10:04:31.458943Z","submitted_at":"2023-09-26T17:36:26Z","title":"VideoDirectorGPT: Consistent Multi-scene Video Generation via LLM-Guided Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15091","snapshot_observed_at":"2026-08-11T14:49:08.843675Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.843675Z"},"links":{"cited_paper":"/paper/2309.15091","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:9265112d82d1a242999849318165d157c03caf095c6b1f28508726566ba95cbb","observation_id":"00aa1965-8e9b-4a68-bbe8-4f771952e744","resolution":{"observed_at":"2026-08-11T14:49:08.843675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.383116Z","title":"Q.; and Lei, S","venue":null,"work_id":"daf39139-a60a-4bf4-b999-07369098a50d","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.847944Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:89528ee86ef3035a9c2c1156c7758da7db305fd664e1e5d6f368c0aed398b539","observation_id":"24affb3b-56d8-43e6-a6a7-830cf003d20b","resolution":{"observed_at":"2026-08-11T14:49:09.388594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.369711Z","title":"E.; Eckstein, M","venue":null,"work_id":"cea0b592-9e50-47b8-b7b4-dda0f96c94c2","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.851942Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:b50cc40915c3905e70f2fbdc191f1146d1f112c98c859cfe84cd719abe4d13a2","observation_id":"7b76ba1a-ecfa-401e-89e3-b9798d9a14b0","resolution":{"observed_at":"2026-08-11T14:49:09.374221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01795","last_updated":"2023-05-02T21:46:44Z","snapshot_observed_at":"2026-08-13T11:50:27.708011Z","submitted_at":"2023-05-02T21:46:44Z","title":"Multimodal Procedural Planning via Dual Text-Image Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01795","snapshot_observed_at":"2026-08-11T14:49:08.856049Z","title":"E.; and Wang, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.856049Z"},"links":{"cited_paper":"/paper/2305.01795","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:892b00c19c10e26fdfa4cb1ff9498beb1d85e9c83e0174e94ef5bfc33eab6e28","observation_id":"62fe9c8b-9799-4a95-8852-8ef2bc278224","resolution":{"observed_at":"2026-08-11T14:49:08.856049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.355551Z","title":null,"venue":null,"work_id":"9599028c-5aa8-4ad8-a3eb-87f1cb72da4c","year":2019},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.860635Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:b0503921b8673bfa942ce618b37a04f2102ec1731adac8f3a3db526f58f84c37","observation_id":"376e6aa1-4f9b-4510-aa98-6c91b535c724","resolution":{"observed_at":"2026-08-11T14:49:09.359713Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.343060Z","title":null,"venue":null,"work_id":"2afe552d-59ff-43dc-968d-78e54798c1d7","year":2024},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.864619Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:c5be580d25a495b5efa1b33fec33cf9e378167dbffd1b28f687b09a45b16f45c","observation_id":"ea943d56-b61a-41b4-951f-c5ab3e59e352","resolution":{"observed_at":"2026-08-11T14:49:09.346541Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T14:49:08.868882Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.868882Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:77d1508e6eb4bc59188adebc55fd1833b6a7a2819e38e37aa0c26b302493d9be","observation_id":"4ec25088-2703-44a6-bcba-f3cfc7e71df8","resolution":{"observed_at":"2026-08-11T14:49:08.868882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:08.872878Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.872878Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:81cdb9ab1288658c5f464fc7166b401df949739a9ec526ad2a9d433781fb9996","observation_id":"94ae40cd-cc7f-4ce5-b8a7-c7dbc941ceab","resolution":{"observed_at":"2026-08-11T14:49:08.872878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.325009Z","title":"W.; Xu, T.; Brockman, G.; McLeavey, C.; and Sutskever, I","venue":null,"work_id":"db6424d0-de8d-4719-ada8-07967a92d217","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.877444Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:6c8ba17a4b160b72179368f962edd885117c947108de5ee40dce1a00e678bb09","observation_id":"7c8f02b2-111a-42ec-bdf7-73e276cba1c2","resolution":{"observed_at":"2026-08-11T14:49:09.328255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.314438Z","title":null,"venue":null,"work_id":"d1c3c0ae-fdc9-47e7-9c6b-45f6102ca8db","year":2021},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.881421Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:662a9dbc709a823a7bf102d832987f815833feb460875adbb4a8ab0cc5a9607c","observation_id":"80bbef9c-ece4-43e5-9016-23f1f6c5d06e","resolution":{"observed_at":"2026-08-11T14:49:09.317989Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.302737Z","title":null,"venue":null,"work_id":"00fb3e8a-9562-4672-9e08-04f5d2adb049","year":2021},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.884976Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:2f64791fc684ab15c09299b1ed0708e69278cf7d4175c8633cb6d0908d887bc6","observation_id":"14ecd0dd-a6f4-472e-961b-460215eba19a","resolution":{"observed_at":"2026-08-11T14:49:09.306590Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.291089Z","title":null,"venue":null,"work_id":"2b68d33d-5945-4fbb-a9fe-3aa9eeb3ec36","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.888324Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:aef67f25ef49b6cbbd4f1184d91751b2856c68f44d22df92a161d18a801ddb2e","observation_id":"23b1f492-326d-4dd8-b1b0-c5a864c906f6","resolution":{"observed_at":"2026-08-11T14:49:09.295544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.279275Z","title":"H.; Sadler, B","venue":null,"work_id":"01ce0a5a-3c06-4f80-bf85-7ac40461d61f","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.891605Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:ec52144a720b00054bd241144b14e978904c2b76b64e096fbeaaf10432c3d6e2","observation_id":"598ba009-f5cd-4530-8272-9e2c58842eb2","resolution":{"observed_at":"2026-08-11T14:49:09.283311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.266502Z","title":null,"venue":null,"work_id":"a450cdb4-3adc-4dbf-be51-c2c4a7de21cd","year":2024},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.895322Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:dfd9b776c9a47336a6721a1d2c6ac73130d69c3cca8db6ca5c5cbad410f2e146","observation_id":"5c6ef65e-f41b-4872-84ed-b9c6a83fd178","resolution":{"observed_at":"2026-08-11T14:49:09.270981Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.254413Z","title":null,"venue":null,"work_id":"e47ee852-495a-4d95-ae57-0cba8e6c36a7","year":2019},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.899103Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:b17061eb96e65d7fbfe3fedf15fea5c78ebf7074184c7728c03ee74b1940b90c","observation_id":"9124f636-ed3c-4f6e-ba19-9b26190776b6","resolution":{"observed_at":"2026-08-11T14:49:09.258180Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T14:49:08.902451Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.902451Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:f6f98d00feb01851311490d85f8a16b0c64c54631f5bd80890032cc5ccbbd682","observation_id":"dd4fa7a6-4250-42e6-ac1d-289d73622c29","resolution":{"observed_at":"2026-08-11T14:49:08.902451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.241279Z","title":null,"venue":null,"work_id":"50b8b07b-aa46-417a-a64b-98deb8f1852b","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.905627Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:997397241871c543c0290e71323e990deb56bd9b097fa1390242b2b4a0f4d1a7","observation_id":"fc121910-51f0-486a-a7f3-67ca2a509bc0","resolution":{"observed_at":"2026-08-11T14:49:09.244619Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-10T01:52:30.999213Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-11T14:49:08.909066Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.909066Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:1d6fd161e3e03bd68533bd3e83a8f072b5d772a3384428e65e4c68beb3356ad4","observation_id":"263817a5-8948-426c-bbda-94e44b92593e","resolution":{"observed_at":"2026-08-11T14:49:08.909066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.229267Z","title":"Z.; Ge, Y.; Wang, X.; Lei, S","venue":null,"work_id":"cda7c9e1-398f-4503-b320-4698a3ad2cb5","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.912657Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:5844446825f84ff1f89e50903f17dece48e823b5ba09ff77798569b7613b37f0","observation_id":"2deac228-7cb7-4aa9-9c5f-88a36854967d","resolution":{"observed_at":"2026-08-11T14:49:09.233322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.215022Z","title":"H.; Miech, A.; Pont - Tuset, J.; Laptev, I.; Sivic, J.; and Schmid, C","venue":null,"work_id":"e3449b93-22c6-4e82-a848-6110010e33fb","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.915869Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:3003e8e25b641084a8b30ff99f12483fa306f23d202ddd0085f5ce680cb2c48b","observation_id":"3a5dc640-8b66-4a9b-a0ea-dc86b1d8a70f","resolution":{"observed_at":"2026-08-11T14:49:09.220251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.202440Z","title":null,"venue":null,"work_id":"69596414-b266-4343-ac2d-bbbb3a921bda","year":2022},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.919591Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:e971d0082b1a3d6f33c4f6b46e3aa9f5f7a727a77ffc13f4e9d2481eb57ea8f8","observation_id":"39972daa-76e7-4027-bbe8-784006803196","resolution":{"observed_at":"2026-08-11T14:49:09.206886Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-11T14:49:08.923237Z","title":"B.; Versari, L.; Sohn, K.; Minnen, D.; Cheng, Y.; Gupta, A.; Gu, X.; Hauptmann, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.923237Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:60524bbaa12192239cf46e25a0f253c3e2f92c096dccaff9eef90c0ce50a8ed5","observation_id":"784b6a82-36b1-4ffe-9c22-1619ecd18db8","resolution":{"observed_at":"2026-08-11T14:49:08.923237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.189157Z","title":"G.; Wildes, R","venue":null,"work_id":"4357e253-b685-483b-aae4-457aa6d153b5","year":2022},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.927426Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:b63f1ba417f14a648e1e09e4976b502496d0e4b6f65882e2c8e9b83e0990ae9f","observation_id":"c17ebd86-dcb9-49a2-8308-8f94be3ee6bc","resolution":{"observed_at":"2026-08-11T14:49:09.193535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-11T14:49:08.931033Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.931033Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:0dcd92a1a960481cc9ef908b4b175d669228201e69526efd33cc255d50cc3f30","observation_id":"9820123e-4482-43f6-bbaf-d247a33215a4","resolution":{"observed_at":"2026-08-11T14:49:08.931033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.176711Z","title":null,"venue":null,"work_id":"59768bf9-1eba-4a52-a696-e5946765af48","year":2023},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.935214Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:720eeffb001f41471ce95326b23f116939135b228ae6faac52c6e15f7fba1d7f","observation_id":"10658eb0-4a2c-472f-9925-e6ed54ea9942","resolution":{"observed_at":"2026-08-11T14:49:09.180515Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.163391Z","title":null,"venue":null,"work_id":"7d2b53aa-13e5-4d89-9248-74cf8e4f3b38","year":2018},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.938944Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:116e964bab5290982066613d2fb12cfa56e4354e29bf3b8b21526de03d827fd4","observation_id":"6dcd6dfa-435f-49f7-aabc-98b375f1bcb8","resolution":{"observed_at":"2026-08-11T14:49:09.167551Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.149727Z","title":null,"venue":null,"work_id":"00f07207-d8e3-4da6-9523-20d639f80a8f","year":2020},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.942721Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:e6d949490e6b71ad856280c20fb10f47c039b77a797071b23aa7300600dde12b","observation_id":"1e4c5177-b20d-49d4-92e9-a7b8df3ffaf0","resolution":{"observed_at":"2026-08-11T14:49:09.154446Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:09.135370Z","title":"G.; Fouhey, D","venue":null,"work_id":"4bcd8264-98ca-42a0-8092-9ad9285b8fc9","year":2019},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.946423Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:34b61f2ad953ea4c5137715d8b6dbcab69a2a2eceb787f069fe071f1185673ed","observation_id":"ad2dbf87-0579-46ce-bd2d-1804976dbdf5","resolution":{"observed_at":"2026-08-11T14:49:09.140752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:08.950286Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.950286Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:b1899f5fa8c92f33d990a3bacec4573be38a707583ef3cf5a7c8bf0e78077fb1","observation_id":"63549908-fe39-45f7-ae68-14993bd8d06a","resolution":{"observed_at":"2026-08-11T14:49:08.950286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:49:08.954450Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T14:49:08.954450Z"},"links":{"citing_paper":"/paper/2412.11621"},"observation_digest":"sha256:67494c6cc87518a8d75e359c9c969d53260ae70b420c8c206e4d9d2c3191eb70","observation_id":"b0daf325-8131-4ca7-8b22-a331bb7f1e31","resolution":{"observed_at":"2026-08-11T14:49:08.954450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.11621","last_updated":"2024-12-16T10:08:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T14:43:28.326688Z","submitted_at":"2024-12-16T10:08:38Z","title":"VG-TVP: Multimodal Procedural Planning via Visually Grounded Text-Video Prompting"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2412.11621."}