{"as_of":"2026-08-21T18:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2c1bad21d0bf165a2ec1a1fdf5ac8ebb7b3c8945d8c2e9e59e44aae71543b75e","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:29:34.575793Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T22:10:29.304091Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T22:11:18.442638Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"cited_work":{"arxiv_id":"2412.04558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04558","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Action-based image editing guided by human in- structions","venue":null,"work_id":"321936de-b6da-4586-a9fb-eea88a4a93ee","year":2024},"citing_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-08-17T20:13:42.723617Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-12T18:17:45.123690Z"},"links":{"cited_paper":"/paper/2412.04558","citing_paper":"/paper/2505.20275"},"observation_digest":"sha256:5961c75deaa11dfd0c26037a5f31ad372efac79d41921d9d8401acd695133b0c","observation_id":"79800015-88b1-4a7d-9fc3-4b47daff650d","resolution":{"observed_at":"2026-05-12T18:17:45.376170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"cited_work":{"arxiv_id":"2412.04558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04558","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Action-based image editing guided by human in- structions","venue":null,"work_id":"321936de-b6da-4586-a9fb-eea88a4a93ee","year":2024},"citing_paper":{"arxiv_id":"2512.13609","last_updated":"2026-05-14T17:13:30Z","snapshot_observed_at":"2026-08-16T17:44:16.598070Z","submitted_at":"2025-12-15T18:03:42Z","title":"Do-Undo Bench: Reversibility for Action Understanding in Image Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T22:10:29.304091Z"},"links":{"cited_paper":"/paper/2412.04558","citing_paper":"/paper/2512.13609"},"observation_digest":"sha256:9056c03be18ae2688a01790391a02c22593b511e9d82f3091b6856ac19c8dd0a","observation_id":"6ef9e391-f335-436b-b298-dd7997b56798","resolution":{"observed_at":"2026-05-16T22:11:18.446425Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.04558/citation-record","integrity":"/paper/2412.04558/integrity","json":"/paper/2412.04558/citation-record.json","paper":"/paper/2412.04558"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:35.121426Z","title":"Black, and G¨ul Varol","venue":null,"work_id":"7e042b7d-9e59-424b-a558-e227cc594648","year":2023},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.385798Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:40136afcba4afae1bf394aa6d07ceb9bf40e2bc7ee2dfe269b186ce3cd1f9bf5","observation_id":"134e2d17-59eb-4086-bf1b-a363d87d3f65","resolution":{"observed_at":"2026-08-11T21:29:35.124468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:35.113300Z","title":"Text2live: Text-driven layered image and video editing","venue":null,"work_id":"17ba0b5d-b411-411f-901c-a973b6fa40db","year":2022},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.390079Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:a5a41c165ddc4779083d5aeb57ad9ccb8c5bef80b25a249d7b6d65a038ec5184","observation_id":"2683423b-e77f-40ce-bd49-06e11da92fa7","resolution":{"observed_at":"2026-08-11T21:29:35.115993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:35.106168Z","title":null,"venue":null,"work_id":"b3e4da06-6edd-4238-b8dc-5568dc66853c","year":2021},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.394143Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:92f6910a45c6f82f28beffc531c0e0987c0a2ed045ab7a574a4160ba966b3124","observation_id":"e194f1e7-a5d8-4053-8992-8642fdcc38c9","resolution":{"observed_at":"2026-08-11T21:29:35.108487Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:35.098980Z","title":null,"venue":null,"work_id":"7d10b277-ab6e-42c4-aef0-9d61a35adce5","year":2023},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.397319Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:120c3bb76526f8545b45b682dfd961283e384f1fd6ed4fda130169854d3a3188","observation_id":"526f2c4f-0138-4ddd-989c-693605fd8c36","resolution":{"observed_at":"2026-08-11T21:29:35.101645Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:35.090076Z","title":"Masactrl: Tuning-free mu- tual self-attention control for consistent image synthesis and editing","venue":null,"work_id":"d32b2838-02a4-4db2-a279-ea0005fc56fe","year":2023},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.400723Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:f3b9f0ab8115f0dc07b6ad137a2be5638eaf3e1734090831a6b854cec994ef55","observation_id":"66422ae7-3c0f-4cb8-80c7-6028a5cea6f5","resolution":{"observed_at":"2026-08-11T21:29:35.094114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:35.080972Z","title":"A short note about kinetics-","venue":null,"work_id":"effa8389-d72f-4889-92d7-ad54377fa5a3","year":null},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.403952Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:d0b484d3b8b63140dc4adddbbe396005611df8f05efd1d8615bdfac84c0fbcfb","observation_id":"569ff669-c47b-415b-b29e-18a1891ea1cc","resolution":{"observed_at":"2026-08-11T21:29:35.084166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:35.071059Z","title":"Freeman, Michael Ru- binstein, Yuanzhen Li, and Dilip Krishnan","venue":null,"work_id":"e00a00c1-2360-46dc-b740-a52ae6bd9b09","year":2023},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.412588Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:51cd2b85f7e8957dbcae23aa4ac9211c6f3302d600e56dc7c74364fa834c6781","observation_id":"ea383fdc-2022-4128-8a52-eb7dbcf1a421","resolution":{"observed_at":"2026-08-11T21:29:35.074504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15134","last_updated":"2022-10-28T02:32:05Z","snapshot_observed_at":"2026-08-16T16:20:47.307040Z","submitted_at":"2022-10-27T02:45:48Z","title":"Learning Variational Motion Prior for Video-based Motion Capture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.15134","snapshot_observed_at":"2026-08-11T21:29:34.416273Z","title":"Learning variational motion prior for video-based motion capture","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.416273Z"},"links":{"cited_paper":"/paper/2210.15134","citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:e1690d2dbf3f3c5d1182d9b56d52b13e99cad9314edf30716e7417d926ec4896","observation_id":"4c982f1b-349b-4eee-a123-f1cb6e74ae4b","resolution":{"observed_at":"2026-08-11T21:29:34.416273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:35.061159Z","title":"Rescaling egocentric vision: Collection, pipeline and challenges for EPIC-KITCHENS-100","venue":null,"work_id":"ceb1837f-cf3d-4056-9258-7d08848cee1e","year":2022},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.420125Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:7c4510a3059bf1cac19f0fb6a2b9f09dc2e8e46c3fc3920426d85547f8bfed4c","observation_id":"20138ca7-6c54-40f8-8506-8f76a6fce4b0","resolution":{"observed_at":"2026-08-11T21:29:35.064935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:35.051829Z","title":"Efros, and Aleksander Holynski","venue":null,"work_id":"d83c3eb6-4ddc-470a-84d9-a98553676d49","year":2023},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.424722Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:dbe756b730d899cadfddddcbd7c225f368a7d67e58f959e3ff762486917e513e","observation_id":"b547e5da-a0d4-48b2-b407-305f07f7debe","resolution":{"observed_at":"2026-08-11T21:29:35.055170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16381","last_updated":"2023-11-01T04:48:26Z","snapshot_observed_at":"2026-08-16T15:29:37.331753Z","submitted_at":"2023-05-25T17:35:38Z","title":"DPOK: Reinforcement Learning for Fine-tuning Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16381","snapshot_observed_at":"2026-08-11T21:29:34.429005Z","title":"DPOK: reinforcement learning for fine-tuning text-to-image diffu- sion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.429005Z"},"links":{"cited_paper":"/paper/2305.16381","citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:a9bea38cd16070746ee12a374ba182930b93310110b8c5a573feb302f82ae26f","observation_id":"cf4b1336-e71e-4b02-915d-9e1f249df1ee","resolution":{"observed_at":"2026-08-11T21:29:34.429005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05802","last_updated":"2024-08-11T15:37:29Z","snapshot_observed_at":"2026-08-16T13:27:10.765765Z","submitted_at":"2024-08-11T15:37:29Z","title":"Egocentric Vision Language Planning","version":1},"cited_work":{"arxiv_id":"2408.05802","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.05802","snapshot_observed_at":"2026-08-11T21:29:34.635846Z","title":"Egocentric Vision Language Planning","venue":"cs.CV","work_id":"2ae48ed5-c454-4994-b0a9-8faac7b3f008","year":2024},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.433291Z"},"links":{"cited_paper":"/paper/2408.05802","citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:126c77f5cf0951f100afd174c634d7d1154b7b16b404a10cba7249b29c520c6e","observation_id":"c19b0ef3-12be-4139-b70b-05d1eee585c1","resolution":{"observed_at":"2026-08-11T21:29:34.640299Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:35.041207Z","title":"Bermano, Gal Chechik, and Daniel Cohen-Or","venue":null,"work_id":"607629a1-16da-4e54-b4fe-f481a4799965","year":2023},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.437802Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:0b6898af16b8883781b3eaa50185caec8b781f385d28c926f65494234865a013","observation_id":"b3b8a9be-fde3-4a9d-8178-04c06650379a","resolution":{"observed_at":"2026-08-11T21:29:35.044866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:35.031059Z","title":"The ”something something” video database for learning and evaluating visual common sense","venue":null,"work_id":"a7ac9d08-283e-457f-a457-775cb5035e57","year":2017},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.441697Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:3231a4f2612e3b10e37d5a727c9d7d9d3fe1b9b4c896e3f8e8fcc13d46beff4c","observation_id":"0bb92f94-a325-4b69-ba4b-2549b154a568","resolution":{"observed_at":"2026-08-11T21:29:35.034629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:35.012018Z","title":"Generating diverse and natu- ral 3d human motions from text","venue":null,"work_id":"c277bf6a-8b96-423e-884f-d3a4682ef6c9","year":2022},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.448253Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:849a744e52bf7a263c85d7aca3a8013aa6a7879890ec4d642013ecdbbc150399","observation_id":"5a127a3f-5ef8-4ae6-a8ac-5a3fd6134f3f","resolution":{"observed_at":"2026-08-11T21:29:35.015739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:35.003523Z","title":"TM2T: stochastic and tokenized modeling for the reciprocal gener- ation of 3d human motions and texts","venue":null,"work_id":"94525a63-5629-4500-9819-cc3102c393bf","year":2022},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.451481Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:066a296316d4a6057f390c3df408c9dbd2a0a5dd9ab299f1f32b8580af5a5aaf","observation_id":"4cb636ea-52b5-40d2-8f63-50215818ea0e","resolution":{"observed_at":"2026-08-11T21:29:35.006542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.994551Z","title":null,"venue":null,"work_id":"82abcec9-6e32-4bf6-b2c4-ed6cad08d53c","year":2024},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.454426Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:43537b651f23348128547ac5f926fbf10ac22bbd12ea158ae9a70e5718f86e24","observation_id":"54e05f4d-1c69-47fc-b435-1955b347f82c","resolution":{"observed_at":"2026-08-11T21:29:34.997839Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.457798Z","title":"Prompt-to-prompt image editing with cross-attention control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.457798Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:ec644e8a1215d29404dd88535c84dbca6b444027e71c73758603caf8bca6b164","observation_id":"a0b4d527-b5a5-49f6-b3c0-c3028b6010fa","resolution":{"observed_at":"2026-08-11T21:29:34.457798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.977850Z","title":"Clipscore: A reference-free evaluation met- ric for image captioning","venue":null,"work_id":"650a7575-13a7-45a2-b382-570d32b3c3be","year":2021},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.462381Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:84fb044ac3487d90d4effcda7fb50b6a727f3c06871eae1f45876eff6a4898ba","observation_id":"1069dadd-e4ad-45fb-95c0-d300fb6813a6","resolution":{"observed_at":"2026-08-11T21:29:34.982248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.968470Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"a708bec9-925b-45a4-bfb9-80851da04421","year":2016},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.465753Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:8c8b0df73729bf427c5edb8d949c16e2ef5bda270626538cc2ca9e9220423657","observation_id":"f4ca5200-106a-4365-b159-366501f26676","resolution":{"observed_at":"2026-08-11T21:29:34.972014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.958585Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"db999ef5-3c86-4ce3-a4ae-ad152f8d7c15","year":2020},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.469539Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:4330763f35ceb802eea2af54d52f80ae7fcb996155ff6a3f95972eed4dffa09c","observation_id":"817e9881-6a40-44ea-9fa5-c1561dbca79e","resolution":{"observed_at":"2026-08-11T21:29:34.962054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.948883Z","title":"KV inversion: KV embeddings learning for text-conditioned real image action editing","venue":null,"work_id":"674ece1d-bc28-405d-aef3-c0a9b9848b72","year":2023},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.473470Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:2c9467633ef57c8b9b56e305ee544a15e806cbdb20ca9219075a3b7fff556630","observation_id":"fa1aa726-f5d6-4c2e-b2d2-46becd3bc546","resolution":{"observed_at":"2026-08-11T21:29:34.952823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.939544Z","title":"Smartedit: Ex- ploring complex instruction-based image editing with mul- timodal large language models","venue":null,"work_id":"ab2ab19d-fb26-44a6-bf31-44c2df320c8d","year":2024},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.477443Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:886abf79d907b44054a0c85cf1dfb4a2a128f907877f77f1d2fbff6d3661b207","observation_id":"f1ef509a-79ca-4623-90b3-a28f94f81d3a","resolution":{"observed_at":"2026-08-11T21:29:34.943188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.928559Z","title":"An edit friendly DDPM noise space: Inversion and manipulations","venue":null,"work_id":"b6b07c8e-ab98-472f-90a0-01c373b8acf7","year":2024},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.481767Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:92051fe2dc3eec6e826f14d36be2bd634ad698eee7382740b1a85c2e996edaaa","observation_id":"95de9274-fb3e-4473-9f12-6e44abfea2dc","resolution":{"observed_at":"2026-08-11T21:29:34.933062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.920017Z","title":"Guided motion diffusion for controllable human motion synthesis","venue":null,"work_id":"ebd7c694-00d7-4b8b-825a-578328dbe7f1","year":2023},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.485186Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:59c1688a0b6afbdccb8da15e1b2c50e25289da3d0cdf30aa6100e0b62e42907c","observation_id":"99c1b573-98c7-44e7-a62e-9a2812845655","resolution":{"observed_at":"2026-08-11T21:29:34.922943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.911565Z","title":"Imagic: Text-based real image editing with diffusion mod- els","venue":null,"work_id":"668ac51d-545d-4811-be5c-215a189442c8","year":2023},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.488762Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:0041d22154a63d086d64f418f52dabd59e8b7b7620435c39757abf7d85c337a3","observation_id":"1f2aff3e-3daa-483c-b369-290f214af9dd","resolution":{"observed_at":"2026-08-11T21:29:34.914735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.903081Z","title":"Li, Mihir Prabhudesai, Shivam Duggal, Ellis Brown, and Deepak Pathak","venue":null,"work_id":"a10e4194-4772-497e-9a86-66fd6e7f9eba","year":2023},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.492718Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:a0ac3a6b91f6f98647a7475dcc2a0add9e3137b0586295fd3e1ee3accff08b5a","observation_id":"0ee3e5ab-0fc5-4143-b68e-488d7854cc11","resolution":{"observed_at":"2026-08-11T21:29:34.906009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.892552Z","title":null,"venue":null,"work_id":"e642fe1a-92ad-4dec-b71f-b1ad89c818f3","year":2023},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.496701Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:506e8d2e44296377c9a1b35836cd10a4def449682e28a624e8ab472010f850ac","observation_id":"a2dd3888-2966-4a01-8c35-951371fc2984","resolution":{"observed_at":"2026-08-11T21:29:34.896536Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.882204Z","title":"Subject- diffusion: Open domain personalized text-to-image genera- tion without test-time fine-tuning","venue":null,"work_id":"f77dd73c-3242-4fee-9f2e-6c0108ab61c4","year":2024},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.500252Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:2fdbb992b699a4ed0ae7955151cbdf956f2f5846350a8d676c7ed6f9ae4b87a7","observation_id":"6a826f65-74f1-4088-bbb1-956b1c0bb7cd","resolution":{"observed_at":"2026-08-11T21:29:34.885889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.871257Z","title":"Dragondiffusion: Enabling drag-style manipula- tion on diffusion models","venue":null,"work_id":"60eb5729-7dd6-4281-b582-15c6d12a106a","year":2024},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.502903Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:eef11414d756a5e023fdf3600257f92210d3735daf89ab184832385960f19c6a","observation_id":"3a028b46-70f2-489d-ba18-4155fd2bb954","resolution":{"observed_at":"2026-08-11T21:29:34.875580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.859720Z","title":"The blessing of ran- domness: SDE beats ODE in general diffusion-based image editing","venue":null,"work_id":"f74fae9b-f7f2-4359-a192-e71c7b4393a1","year":2024},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.505783Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:83db43a05dec58cdbff7145dbc2ffe5e85f49f1b01b0485b9c0ce00a47c3dd30","observation_id":"7f7f5955-6ba4-4f44-9f04-8be5db66cd6c","resolution":{"observed_at":"2026-08-11T21:29:34.863708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.839600Z","title":"Black, and G ¨ul Varol","venue":null,"work_id":"ea220ff5-b34f-4c2a-8927-74478a42b0bb","year":2021},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.511848Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:c5d169bdb99c99bb05c052b22336f24e7d5f5d32de80147ecbbdea10c0289e8d","observation_id":"f6802eb1-a0ea-4879-b94b-fa9f9ac22b08","resolution":{"observed_at":"2026-08-11T21:29:34.844055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.829635Z","title":"Black, and G ¨ul Varol","venue":null,"work_id":"23e321f6-428b-4edc-bcb6-ceefa7d30fbe","year":2022},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.515341Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:8d16580633f912d3e3ec18109e30fbcc62fe52f7ba93017b84ae95e66cf36ab7","observation_id":"d87fe089-dc1c-4c0c-9c98-e721a8269f66","resolution":{"observed_at":"2026-08-11T21:29:34.833384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.819115Z","title":"Recognizing fine-grained and composite ac- tivities using hand-centric features and script data","venue":null,"work_id":"77945c1f-9818-4f93-96d7-ab8d0ef3a16a","year":2016},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.519084Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:a11c49452a269cfbef3d03f1f35c79416284934c907e49efe9217c168cb03b4b","observation_id":"b10093c8-0581-4552-9b80-94d3b15d88bd","resolution":{"observed_at":"2026-08-11T21:29:34.823295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.809607Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"15f2db27-eb9c-4a89-8597-473d602e694a","year":2022},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.522113Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:e41c041a8e552f80cab24940852320301429ebc0f69b2ac4bb7c6c9e983ccf57","observation_id":"f16485b6-93e2-4f9e-9506-3e181f140ae3","resolution":{"observed_at":"2026-08-11T21:29:34.812470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.800940Z","title":"Emu edit: Precise image editing via recognition and genera- tion tasks","venue":null,"work_id":"00ca22b5-306b-440d-8a2c-c63b3b79d9b8","year":2024},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.525368Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:daaa90169321306ec41ee927c7f0a49de654f0e1304faf049a340a27c68fdcd3","observation_id":"c490986c-9899-4add-aee4-b2b84d0209c3","resolution":{"observed_at":"2026-08-11T21:29:34.804254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.792150Z","title":null,"venue":null,"work_id":"9a3775b9-8d94-445b-9a7a-553bf29ca7b5","year":2024},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.528993Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:e0229fe1216c306803ec59d2cbdecaae830f0bd9a1713762b6a1c0abe19c9306","observation_id":"e92bf735-788f-4e61-91b7-5e3f945d1226","resolution":{"observed_at":"2026-08-11T21:29:34.795102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.781768Z","title":"Denois- ing diffusion implicit models","venue":null,"work_id":"3f5393c5-b414-481f-800b-4f94079fab95","year":2021},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.532311Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:f177f7a109759c80656daa54694ed6fb7d5f504216da5c9143eaf22d36c60346","observation_id":"08567252-c63d-4677-8228-403709c581d3","resolution":{"observed_at":"2026-08-11T21:29:34.785696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18020","last_updated":"2024-04-27T22:45:47Z","snapshot_observed_at":"2026-08-17T13:43:48.964112Z","submitted_at":"2024-04-27T22:45:47Z","title":"DM-Align: Leveraging the Power of Natural Language Instructions to Make Changes to Images","version":1},"cited_work":{"arxiv_id":"2404.18020","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.18020","snapshot_observed_at":"2026-08-11T21:29:34.618412Z","title":"DM-Align: Leveraging the Power of Natural Language Instructions to Make Changes to Images","venue":"cs.CV","work_id":"de2ef708-6a58-4274-932f-4df8f924f225","year":2024},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.535877Z"},"links":{"cited_paper":"/paper/2404.18020","citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:0b2386f220324a067ed61a1804cba956f9590433a27940409f552391b29ad6bd","observation_id":"661b8c48-8f3e-4a17-b883-9cf855abc4d0","resolution":{"observed_at":"2026-08-11T21:29:34.625228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.769688Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":"8eda6550-373a-403b-aee3-a33689a2c617","year":2023},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.539741Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:41f68d33a10f329e01c5af2c7ad296b5db51a35b3b19d160461af77bd4a17b30","observation_id":"49fd20dd-5a13-4f03-9231-5528f961ce67","resolution":{"observed_at":"2026-08-11T21:29:34.774440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.757558Z","title":"Synthesizing long-term 3d human motion and interaction in 3d scenes","venue":null,"work_id":"11cf5d73-f370-406a-a9cd-dd76acd48c3a","year":2021},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.544201Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:b5f6ad9fc27279ecfce2abf2e0c49dc8d794d366a21e8ac8a564da5d03dcbc71","observation_id":"bd9e0351-b017-454f-87e3-98f4139e2b90","resolution":{"observed_at":"2026-08-11T21:29:34.762487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.746236Z","title":"Dynamic prompt learning: Address- ing cross-attention leakage for text-based image editing","venue":null,"work_id":"1c0aa663-a855-4e02-ac24-4621139a2bff","year":2023},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.547840Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:ec4deeee1bd8986102d237476909b05111b0f6aefbedd457e789920294533b24","observation_id":"6ce74820-17d8-4604-92cb-7254b277848a","resolution":{"observed_at":"2026-08-11T21:29:34.750138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.735926Z","title":"In-context learning unlocked for diffusion models","venue":null,"work_id":"30b74355-a55d-49fb-8aaa-82d317a8cee8","year":2023},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.550358Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:8463215624b7c11152a4c4e17d6126417a83ebdf857d7cbef30cd1f9955dc149","observation_id":"4dff56a6-9144-44b9-b9e2-3310acb80926","resolution":{"observed_at":"2026-08-11T21:29:34.739533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-08-15T10:03:23.497428Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-11T21:29:34.553386Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.553386Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:974ea9e3695a7964cddde8162bf53ece3d14d8b1c658675c4a5b189a94f5fe6d","observation_id":"a6d8a6be-aa2d-4198-8fd2-a59cfd3aea01","resolution":{"observed_at":"2026-08-11T21:29:34.553386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.725390Z","title":"Mastering text-to-image diffu- sion: Recaptioning, planning, and generating with multi- modal llms","venue":null,"work_id":"39de980f-ab99-4b88-9d65-dade73f0e7d7","year":2024},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.556148Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:b3784109e1872dca1d5924834dabaef6814db46456a51e3f93fc6a208e66e84e","observation_id":"df038ec7-d3aa-426f-9df8-cf776de60e6e","resolution":{"observed_at":"2026-08-11T21:29:34.729032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.703919Z","title":"Zero-shot contrastive loss for text-guided diffusion image style transfer","venue":null,"work_id":"f079b891-7643-4059-9cfb-6132e2a9da3d","year":2023},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.563627Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:bf49ff9c36c118c327459f8006dfb96030d0463d02f66eeb20fabde70e645a05","observation_id":"581a8051-e03b-46db-be7a-5536c2c59ee1","resolution":{"observed_at":"2026-08-11T21:29:34.708203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.567079Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.567079Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:17a4fa5cc208ae45e2baab6b03aa45d4beb4f3c581dda10371090e4bae3ecf0b","observation_id":"c7f522ae-79f7-4f80-ac27-58fb8b22d250","resolution":{"observed_at":"2026-08-11T21:29:34.567079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.687805Z","title":"Learning motion priors for 4d human body capture in 3d scenes","venue":null,"work_id":"a84aa0a8-444e-4ac1-9be0-c38c8ff84233","year":2021},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.571554Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:a044bbd6b4c632f2d357568d1ce9261cbafb4a0931560173fc5dcc4a735bc369","observation_id":"1db6ccb5-4b2e-4fa4-a5d2-9a81b67e1ef0","resolution":{"observed_at":"2026-08-11T21:29:34.691331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.715474Z","title":null,"venue":null,"work_id":"c018e1c9-a969-484d-838c-64ec70056e82","year":2024},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.559855Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:31fcb9f8595ed0f85ac02740c58198e841476d6563dbfdde98b8c060912d795c","observation_id":"e9c57bbf-5ebd-4c77-901e-c2bd906d6f47","resolution":{"observed_at":"2026-08-11T21:29:34.718905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.677327Z","title":"LC and HC datasets LC dataset","venue":null,"work_id":"24cc0ce7-0589-4ff6-ae18-608154e39471","year":null},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.575793Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:c4ffa57106187dfb1f4d6e818adeb9cedb725d8a0d3d1757e4d603ca1591c53f","observation_id":"a65674b6-8720-4a5e-a586-1428854a4938","resolution":{"observed_at":"2026-08-11T21:29:34.680982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.01340","last_updated":"2018-08-03T20:17:05Z","snapshot_observed_at":"2026-08-15T17:51:24.030376Z","submitted_at":"2018-08-03T20:17:05Z","title":"A Short Note about Kinetics-600","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.01340","snapshot_observed_at":"2026-08-11T21:29:34.408330Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":600,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.408330Z"},"links":{"cited_paper":"/paper/1808.01340","citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:577c432c3751092d78d3db5990d7fd694ce1a15e4607a014bee65a8532af5c9e","observation_id":"bd188bc5-9ac7-4591-a057-fb860c600ad2","resolution":{"observed_at":"2026-08-11T21:29:34.408330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:34.850200Z","title":null,"venue":null,"work_id":"6190ea63-7f9a-4a74-b323-6161ef37b4a3","year":2024},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.508777Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:24fff9c444cb027343e550659c47616f16dcb795cdca54b72e91e104ce0381e5","observation_id":"3d6f4a8f-25f4-45aa-99b5-96b53259e183","resolution":{"observed_at":"2026-08-11T21:29:34.853586Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:29:35.021971Z","title":null,"venue":null,"work_id":"a9489a74-cfd3-4f9e-9267-cbb3e9ecbfe7","year":2017},"citing_paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions","version":2},"reference_index":5851,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:34.445062Z"},"links":{"citing_paper":"/paper/2412.04558"},"observation_digest":"sha256:8738f1abf696a68431905a2064ddd851a202a55610b3b5681947aabfb743fbf5","observation_id":"c4c6ff21-9dbe-4734-b24d-72c2726707e1","resolution":{"observed_at":"2026-08-11T21:29:35.025206Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.04558","last_updated":"2025-02-04T14:44:13Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T03:30:53.984733Z","submitted_at":"2024-12-05T19:01:41Z","title":"Action-based image editing guided by human instructions"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":13,"verified_exact":2,"verified_fuzzy":37},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 2 inbound Pith citation observations for arXiv:2412.04558."}