{"as_of":"2026-08-17T17:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb0174059a033c1e9ee1aea9b56856557ac92e6102b5bbe05c51c42920609914","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:27:47.950451Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:39:33.284170Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T19:36:08.845862Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"cited_work":{"arxiv_id":"2411.13451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.13451","snapshot_observed_at":"2026-07-01T19:36:08.845862Z","title":"Adaptagent: Adapting multimodal web agents with few-shot learning from human demonstrations","venue":null,"work_id":"8dba372a-b244-4199-a234-d20a9d4e8875","year":2024},"citing_paper":{"arxiv_id":"2411.18279","last_updated":"2025-05-06T15:08:00Z","snapshot_observed_at":"2026-08-17T10:40:45.253009Z","submitted_at":"2024-11-27T12:13:39Z","title":"Large Language Model-Brained GUI Agents: A Survey","version":12},"reference_index":294,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:27.472508Z"},"links":{"cited_paper":"/paper/2411.13451","citing_paper":"/paper/2411.18279"},"observation_digest":"sha256:94085b6e1b37fefa0298e7af674aeee606deaf532f13edb63d3d81f6277e0faf","observation_id":"3c7bcfbb-7281-4ecf-adcc-28c37d490299","resolution":{"observed_at":"2026-05-19T11:08:27.935795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"cited_work":{"arxiv_id":"2411.13451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.13451","snapshot_observed_at":"2026-07-01T19:36:08.845862Z","title":"Adaptagent: Adapting multimodal web agents with few-shot learning from human demonstrations","venue":null,"work_id":"8dba372a-b244-4199-a234-d20a9d4e8875","year":2024},"citing_paper":{"arxiv_id":"2506.03530","last_updated":"2026-05-22T06:55:17Z","snapshot_observed_at":"2026-08-16T00:23:12.907925Z","submitted_at":"2025-06-04T03:22:44Z","title":"How Far Are We from Generating Missing Modalities with Foundation Models?","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-25T08:15:12.947854Z"},"links":{"cited_paper":"/paper/2411.13451","citing_paper":"/paper/2506.03530"},"observation_digest":"sha256:ef31ff03a72d27bc4d61ec115250a3afb568accabf24b4fe58b9a07e74fd3c45","observation_id":"0ab2517b-68f6-48ab-8557-ccb0ef8e018c","resolution":{"observed_at":"2026-05-25T08:15:33.568089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"cited_work":{"arxiv_id":"2411.13451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.13451","snapshot_observed_at":"2026-07-01T19:36:08.845862Z","title":"Adaptagent: Adapting multimodal web agents with few-shot learning from human demonstrations","venue":null,"work_id":"8dba372a-b244-4199-a234-d20a9d4e8875","year":2024},"citing_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-05-14T22:23:14.621091Z"},"links":{"cited_paper":"/paper/2411.13451","citing_paper":"/paper/2507.21046"},"observation_digest":"sha256:62a040c863f505ee3c1fb95d8e907f7b0c757ba6e72b95b709fc4db483e0af32","observation_id":"4cee231e-b9a5-4934-8753-36ce2714661d","resolution":{"observed_at":"2026-05-14T22:23:14.807843Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"cited_work":{"arxiv_id":"2411.13451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.13451","snapshot_observed_at":"2026-07-01T19:36:08.845862Z","title":"Adaptagent: Adapting multimodal web agents with few-shot learning from human demonstrations","venue":null,"work_id":"8dba372a-b244-4199-a234-d20a9d4e8875","year":2024},"citing_paper":{"arxiv_id":"2604.20148","last_updated":"2026-04-22T03:25:17Z","snapshot_observed_at":"2026-08-13T22:51:09.924901Z","submitted_at":"2026-04-22T03:25:17Z","title":"Meta-Tool: Efficient Few-Shot Tool Adaptation for Small Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-10T00:50:27.257888Z"},"links":{"cited_paper":"/paper/2411.13451","citing_paper":"/paper/2604.20148"},"observation_digest":"sha256:a1da6f7d8d58025b9fd54c7cc6dd32799d146d4eb4cf1846e8f471d465e8bf8f","observation_id":"d2b029cd-acf1-4010-b500-ee287d712c1d","resolution":{"observed_at":"2026-05-10T00:54:48.826369Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"cited_work":{"arxiv_id":"2411.13451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.13451","snapshot_observed_at":"2026-07-01T19:36:08.845862Z","title":"Adaptagent: Adapting multimodal web agents with few-shot learning from human demonstrations","venue":null,"work_id":"8dba372a-b244-4199-a234-d20a9d4e8875","year":2024},"citing_paper":{"arxiv_id":"2605.31365","last_updated":"2026-05-29T14:37:27Z","snapshot_observed_at":"2026-08-12T15:20:37.408690Z","submitted_at":"2026-05-29T14:37:27Z","title":"Learning to Adapt: Self-Improving Web Agent via Cognitive-Aware Exploration","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T22:18:15.244033Z"},"links":{"cited_paper":"/paper/2411.13451","citing_paper":"/paper/2605.31365"},"observation_digest":"sha256:a09b21cae91b0461aca71bc9dac3fe8f419d240460b88db77ac5bef1cfa147cb","observation_id":"98a0c1ce-927c-4561-819e-a0cfa7292d0f","resolution":{"observed_at":"2026-07-01T19:36:08.847746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13451","snapshot_observed_at":"2026-08-16T00:39:33.284170Z","title":"Wang, D.; Shelhamer, E.; Liu, S.; Olshausen, B.; and Dar- rell, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11588","last_updated":"2026-08-12T02:55:50Z","snapshot_observed_at":"2026-08-17T12:31:22.956221Z","submitted_at":"2026-08-12T02:55:50Z","title":"CoAdapt-GUI: Joint Workflow Context and Policy Adaptation for Unseen GUI Applications","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:39:33.284170Z"},"links":{"cited_paper":"/paper/2411.13451","citing_paper":"/paper/2608.11588"},"observation_digest":"sha256:aeb57ebf2c8238dd46c2eb8181bc258340d9295c5a6554026434b044eccb29c2","observation_id":"bba51d67-c2ef-4b44-a4a9-0d2a042fd53e","resolution":{"observed_at":"2026-08-16T00:39:33.284170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.13451/citation-record","integrity":"/paper/2411.13451/integrity","json":"/paper/2411.13451/citation-record.json","paper":"/paper/2411.13451"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.649523Z","title":"Apprenticeship learning via inverse reinforcement learning","venue":null,"work_id":"0de666ff-36fe-4fb5-98eb-303d242ba1fd","year":2004},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.700852Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:0162dfb0305ab351177adb3a480783fd135dadc327d6935ef09922ee6258ac48","observation_id":"36dc160f-1a51-4c9d-b95a-67b8bd07de61","resolution":{"observed_at":"2026-08-12T16:27:48.653399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T16:27:47.705207Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.705207Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:48962a8d69e661fb09ec2a0ed1de11dbab356a8ea44c454cc35f6777be6ee29e","observation_id":"b0fa7292-210a-4f63-abd5-d8d2523f5af9","resolution":{"observed_at":"2026-08-12T16:27:47.705207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.637666Z","title":"A survey of robot learning from demonstration","venue":null,"work_id":"4891a00b-9500-42ef-9010-aec7d5f5717d","year":2009},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.710116Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:cf1eeab880999a9ec9a1668259ecddc71dc6e8f283f8ffd624429cfc9d6ccf55","observation_id":"512697fa-9823-4bf3-9468-0c11d5ac94a3","resolution":{"observed_at":"2026-08-12T16:27:48.641628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00200","last_updated":"2025-03-03T19:53:28Z","snapshot_observed_at":"2026-08-16T13:56:27.118134Z","submitted_at":"2024-04-30T21:06:52Z","title":"In-Context Learning with Long-Context Models: An In-Depth Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00200","snapshot_observed_at":"2026-08-12T16:27:47.714301Z","title":"In-context learning with long-context models: An in-depth exploration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.714301Z"},"links":{"cited_paper":"/paper/2405.00200","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:1840a85de4c7f63f6a6d966f5f7591c149f29c3510e28156e56144e7620000ea","observation_id":"d094a3c2-ee60-4ade-9a53-5a077effa084","resolution":{"observed_at":"2026-08-12T16:27:47.714301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05291","last_updated":"2025-02-05T21:50:07Z","snapshot_observed_at":"2026-08-16T13:36:28.398126Z","submitted_at":"2024-07-07T07:15:49Z","title":"WorkArena++: Towards Compositional Planning and Reasoning-based Common Knowledge Work Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05291","snapshot_observed_at":"2026-08-12T16:27:47.718496Z","title":"Workarena++: Towards compositional planning and reasoning-based common knowledge work tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.718496Z"},"links":{"cited_paper":"/paper/2407.05291","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:fd86b6073c264e05dcbf02502e586e431f43ef6b607cbd81a42e7935c562478b","observation_id":"22048b7f-6e44-48f6-88c3-a0c4f462d600","resolution":{"observed_at":"2026-08-12T16:27:47.718496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.626783Z","title":"Robots that imitate humans","venue":null,"work_id":"8d914c77-bafa-47b6-ad99-7e3d02f3b458","year":2002},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.723127Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:4125965cf8ad6e147e648520de02b315a2e9ce9b2a065d855c331ea0b8addf3b","observation_id":"bc4cf55c-5ee0-4089-9157-db24a5ba320a","resolution":{"observed_at":"2026-08-12T16:27:48.630462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.615294Z","title":"Extrapolating beyond sub- optimal demonstrations via inverse reinforcement learning from observations","venue":null,"work_id":"3e52cce6-b565-4cea-9829-1f877e1132fe","year":2019},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.727562Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:c34548236ebf958cd48537d01837d38514182d2f7b4c5c9385298e224770d497","observation_id":"bbfb3c10-2aed-4e9b-b3f0-1affec31d539","resolution":{"observed_at":"2026-08-12T16:27:48.619461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-12T16:27:47.731275Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.731275Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:8c097d5768f30401d5387087096f20002a1d380c859bedbbccf738311354263a","observation_id":"fee9e695-b9f0-47a0-a74b-f4e9d8d28ea4","resolution":{"observed_at":"2026-08-12T16:27:47.731275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.603745Z","title":"Learning and reproduction of gestures by imitation","venue":null,"work_id":"a7daed33-5c39-41d5-819c-9b465ee376e5","year":2010},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.735082Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:cded1f3f34a4819096fb66821bfd3e6530e5c4365256bb0e1ac3e7bc96b4c6d9","observation_id":"8f42f47b-25d0-4b60-b9e3-1b9078764edd","resolution":{"observed_at":"2026-08-12T16:27:48.607701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.592020Z","title":"On learning, representing, and generalizing a task in a humanoid robot","venue":null,"work_id":"b5893a4a-b214-4cbe-adcc-be2b68501902","year":2007},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.738915Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:aba8935b14d4b700653320d9c2c33b69b8ad36b95b77d2dd5d0e679193da14db","observation_id":"5ca0d8fa-5faf-4810-8133-a0efbaca725b","resolution":{"observed_at":"2026-08-12T16:27:48.596177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:47.742770Z","title":"Learning from suboptimal demonstration via self-supervised reward regression","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.742770Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:9362e71e964cf61dc7555e87523d5bc286cce54df0e0c7e9525571e479e676a0","observation_id":"10ef0918-974e-4a62-8ca4-3d71230ee7ab","resolution":{"observed_at":"2026-08-12T16:27:47.742770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-13T02:23:45.428162Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10935","snapshot_observed_at":"2026-08-12T16:27:47.746661Z","title":"Seeclick: Harnessing gui grounding for advanced visual gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.746661Z"},"links":{"cited_paper":"/paper/2401.10935","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:9d10532eb280b61ec04fe4dfa8bdf35d2e7d834f85e857167b6a765a8f1a80fa","observation_id":"68567748-7b01-4b7d-a599-8d198d91e000","resolution":{"observed_at":"2026-08-12T16:27:47.746661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.573058Z","title":"Model-based inverse reinforcement learning from visual demonstrations","venue":null,"work_id":"e2adb609-266b-4b94-adf4-401db29a5eee","year":1930},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.750462Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:9050707c1b3c74dd17c104202e3afa347cf02e5f6327fb7c872e9bc3a662c8f4","observation_id":"e6cfdd05-6927-4ae3-8f9a-8aa130279110","resolution":{"observed_at":"2026-08-12T16:27:48.577094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:47.754205Z","title":"Mind2web: Towards a generalist agent for the web, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.754205Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:10d541d1f4be05e82878e657e8c4794706ecf09cc4041debf4d9501a11492dde","observation_id":"26be4b1a-8596-4368-b384-83128fcb38a5","resolution":{"observed_at":"2026-08-12T16:27:47.754205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.555950Z","title":"Inverse kkt: Learning cost functions of manipulation tasks from demonstrations","venue":null,"work_id":"8f230295-d080-4617-875c-867f41432f4a","year":2017},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.757739Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:9d9c2b6cb880b1afe28b307ff9aa92bc483bbe665cbfb90679a7f8182e97b896","observation_id":"645cd879-aeef-498c-bf16-62ed8b84eaa8","resolution":{"observed_at":"2026-08-12T16:27:48.559417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:47.761368Z","title":"Model-agnostic meta-learning for fast adap- tation of deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.761368Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:50a97dafa3851a04a2d70dd318301a680c195a60e595cdbc225b860f39dc5021","observation_id":"1f4cb291-fa46-4370-863c-debdc7cd83af","resolution":{"observed_at":"2026-08-12T16:27:47.761368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.538309Z","title":"One-shot visual imitation learning via meta-learning","venue":null,"work_id":"56dfd122-6706-445a-ac60-2d075cbfbf95","year":2017},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.765045Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:dd100bf9708d9492e99bb5a28765a95f537094ff360578ff333035f7436a1d6f","observation_id":"65dd1256-87f8-4b10-af70-77b851a19385","resolution":{"observed_at":"2026-08-12T16:27:48.542552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6572","last_updated":"2015-03-20T20:19:16Z","snapshot_observed_at":"2026-08-12T17:13:46.394331Z","submitted_at":"2014-12-20T01:17:12Z","title":"Explaining and Harnessing Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6572","snapshot_observed_at":"2026-08-12T16:27:47.768429Z","title":"Explaining and harnessing adversar- ial examples","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.768429Z"},"links":{"cited_paper":"/paper/1412.6572","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:7abb7c485e2bb865040dc711e1e319ec40357a1a6eb0d71f47efdd2e14e0b038","observation_id":"da3549be-eb60-4837-8a12-47486dcd957a","resolution":{"observed_at":"2026-08-12T16:27:47.768429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.526077Z","title":"A real-world webagent with planning, long context understanding, and program synthesis, 2024","venue":null,"work_id":"65382be1-6154-4316-bc38-1fef4810101d","year":2024},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.773192Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:3edee6e962af8120111630d0ee43b8f28df322f547c64290cdfa8dcb9706a708","observation_id":"503ce36d-62a1-49b0-be57-810cdaa47455","resolution":{"observed_at":"2026-08-12T16:27:48.530480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13919","last_updated":"2024-06-06T18:37:34Z","snapshot_observed_at":"2026-08-15T01:23:25.524198Z","submitted_at":"2024-01-25T03:33:18Z","title":"WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13919","snapshot_observed_at":"2026-08-12T16:27:47.777143Z","title":"Webvoyager: Building an end-to-end web agent with large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.777143Z"},"links":{"cited_paper":"/paper/2401.13919","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:a2dfe3bcc6902abbe229da02eedbb827f961d5b4ecf31f8034a2f622ae562e63","observation_id":"6ade81d5-e693-4ba9-b627-95df74eee4fd","resolution":{"observed_at":"2026-08-12T16:27:47.777143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:47.780855Z","title":"Generative adversarial imitation learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.780855Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:268acfdc80036589567118c98e7ff31477801475d4d63a456c3f5b6163a516a1","observation_id":"2a008cdd-c087-4a69-83af-a9655f8c39c7","resolution":{"observed_at":"2026-08-12T16:27:47.780855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:47.784919Z","title":"Cogagent: A visual language model for gui agents, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.784919Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:c92022b3513e1b48719523173114079b963e2b4e54f58d2b7d2ad19af424f4d6","observation_id":"a60f0ea9-a0eb-4ca4-ab11-b3057dcfe166","resolution":{"observed_at":"2026-08-12T16:27:47.784919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:47.788505Z","title":"A data-driven approach for learning to control computers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.788505Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:c4417670cf531bf4f69a60cc5f17c988c2fa85739e69f49b58c076fc75d46980","observation_id":"e878e8d1-cc08-4a6b-8d3a-7a2ae31b1a10","resolution":{"observed_at":"2026-08-12T16:27:47.788505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.493445Z","title":"Imitation learning: A survey of learning methods","venue":null,"work_id":"941ca579-752f-42f0-9e8f-070226d462ea","year":2017},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.792368Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:807eeba31d717010524380a0988b44accee1d29216e566d12e9fc4f98721e698","observation_id":"23d1814c-6a2e-4bac-9db8-6dbb0f293a6c","resolution":{"observed_at":"2026-08-12T16:27:48.497339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07828","last_updated":"2022-03-15T12:32:28Z","snapshot_observed_at":"2026-08-16T17:14:27.455898Z","submitted_at":"2022-03-15T12:32:28Z","title":"Do BERTs Learn to Use Browser User Interface? Exploring Multi-Step Tasks with Unified Vision-and-Language BERTs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.07828","snapshot_observed_at":"2026-08-12T16:27:47.796305Z","title":"Do berts learn to use browser user interface? exploring multi-step tasks with unified vision-and-language berts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.796305Z"},"links":{"cited_paper":"/paper/2203.07828","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:4e91647521cf953cfe3c958aeb3fb570c581e4642febd9341aaa09738a4dfd42","observation_id":"4ae50598-436b-4acf-9b48-44c0a66cce34","resolution":{"observed_at":"2026-08-12T16:27:47.796305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.481981Z","title":"Data-efficient alignment of large language models with human feedback through natural language, 2023","venue":null,"work_id":"03ed9ec8-25c2-48c2-8d0f-cf2d360291a1","year":2023},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.800650Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:b09121847ce844950762f0ac720e74f09404d39b3cd995a8563579e139f0193b","observation_id":"7e95e77f-1bf4-4590-b939-3e377113422d","resolution":{"observed_at":"2026-08-12T16:27:48.486085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03714","last_updated":"2023-10-05T17:37:25Z","snapshot_observed_at":"2026-08-04T05:21:05.846165Z","submitted_at":"2023-10-05T17:37:25Z","title":"DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03714","snapshot_observed_at":"2026-08-12T16:27:47.804545Z","title":"Dspy: Compiling declarative language model calls into self-improving pipelines","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.804545Z"},"links":{"cited_paper":"/paper/2310.03714","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:7f3fc6f8d86998ecec613658124e7f013099f2689eb2a5795087ad27901e6b03","observation_id":"8d5919ed-eeac-4762-bc9a-291e66e85c36","resolution":{"observed_at":"2026-08-12T16:27:47.804545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13649","last_updated":"2024-06-06T02:01:09Z","snapshot_observed_at":"2026-08-15T00:56:43.641640Z","submitted_at":"2024-01-24T18:35:21Z","title":"VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13649","snapshot_observed_at":"2026-08-12T16:27:47.808938Z","title":"Visualwebarena: Evaluating multimodal agents on realistic visual web tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.808938Z"},"links":{"cited_paper":"/paper/2401.13649","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:2cbe1fcb51d71f65ea4b95b869b476dcd3dc61d2e7b6cc0473567c4450229c9d","observation_id":"e73b708a-d00e-4714-983a-66b3884d8548","resolution":{"observed_at":"2026-08-12T16:27:47.808938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.470763Z","title":"Learning driving styles for autonomous vehicles from demonstration","venue":null,"work_id":"a4267b04-cdd4-49ba-9525-afb8f33b6b30","year":2015},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.813101Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:e91b2f1b08753a1af46f427171045dcfaa698ddee28c75db6c64c99796fa9b09","observation_id":"8ef48656-a7b5-48ea-920e-8bcd54894348","resolution":{"observed_at":"2026-08-12T16:27:48.474745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03648","last_updated":"2024-10-12T05:05:38Z","snapshot_observed_at":"2026-08-16T14:03:32.564937Z","submitted_at":"2024-04-04T17:58:40Z","title":"AutoWebGLM: A Large Language Model-based Web Navigating Agent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03648","snapshot_observed_at":"2026-08-12T16:27:47.817076Z","title":"Autowebglm: Bootstrap and reinforce a large language model-based web navigating agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.817076Z"},"links":{"cited_paper":"/paper/2404.03648","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:f90f152b4292a64092a05fc17fd0b30f002b0b6b927d50aee0bec9a91bfe6c3b","observation_id":"02546779-c88a-400d-b572-98acc7483112","resolution":{"observed_at":"2026-08-12T16:27:47.817076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.08802","last_updated":"2018-02-24T05:32:47Z","snapshot_observed_at":"2026-08-14T19:42:39.161822Z","submitted_at":"2018-02-24T05:32:47Z","title":"Reinforcement Learning on Web Interfaces Using Workflow-Guided Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.08802","snapshot_observed_at":"2026-08-12T16:27:47.821155Z","title":"Reinforcement learning on web interfaces using workflow-guided exploration.arXiv preprint arXiv:1802.08802, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.821155Z"},"links":{"cited_paper":"/paper/1802.08802","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:30476c92a90afb1fcc6d73ce9181ef07618c9997ddecc0680b1bbb657c19dc3c","observation_id":"462787f6-5cee-427a-b63a-6863a5e82316","resolution":{"observed_at":"2026-08-12T16:27:47.821155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:47.825408Z","title":"What makes good data for alignment? a comprehensive study of automatic data selection in instruction tuning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.825408Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:ec330fd7ffd8c9be3f52145babae8c3922db553f4efd3477316200e179aed7dc","observation_id":"129c7208-ae37-4fd9-927c-0ba4be703854","resolution":{"observed_at":"2026-08-12T16:27:47.825408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:47.829552Z","title":"Algorithms for inverse reinforcement learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.829552Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:b5c292400ea76c56041f1f4fc690d1cfef8bc9e981bba8dbac4beb1d31a075a7","observation_id":"b49a2526-84ce-4e61-8a3d-3a6f89f52f03","resolution":{"observed_at":"2026-08-12T16:27:47.829552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02999","last_updated":"2018-10-22T16:11:14Z","snapshot_observed_at":"2026-08-14T19:38:16.450214Z","submitted_at":"2018-03-08T08:29:38Z","title":"On First-Order Meta-Learning Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02999","snapshot_observed_at":"2026-08-12T16:27:47.833325Z","title":"On first-order meta-learning algorithms","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.833325Z"},"links":{"cited_paper":"/paper/1803.02999","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:0f9c7334ec6336d48f077ad10b06dd698e12c36a5c64cc85b53397880af4c3fa","observation_id":"e0eb73c7-227f-40ba-9e0b-9302b2425bda","resolution":{"observed_at":"2026-08-12T16:27:47.833325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:47.837650Z","title":"Experimental evidence on the productivity effects of generative artificial intelligence","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.837650Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:89aebfa99a4d5c3fa70c680d9824c78283e2b508a79e42fa57ee0fb988fa3331","observation_id":"eb4f907c-2645-4cfd-a803-26757d210177","resolution":{"observed_at":"2026-08-12T16:27:47.837650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.438220Z","title":"Oracle AI agents help organizations achieve new levels of productivity, Sep 2024","venue":null,"work_id":"f096be50-f3ce-44bf-a356-7580c798fa18","year":2024},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.841443Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:38b238db6093bcb9ccc01a7d241a56687c76a27ff0f5646844d5bd9c3dd5e6ca","observation_id":"606cc77e-edc6-47c3-b1f1-83201b1e33bd","resolution":{"observed_at":"2026-08-12T16:27:48.442381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15637","last_updated":"2024-11-27T16:34:52Z","snapshot_observed_at":"2026-08-16T13:16:02.937575Z","submitted_at":"2024-09-24T00:51:45Z","title":"Synatra: Turning Indirect Knowledge into Direct Demonstrations for Digital Agents at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15637","snapshot_observed_at":"2026-08-12T16:27:47.845089Z","title":"Synatra: Turning indirect knowledge into direct demonstrations for digital agents at scale","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.845089Z"},"links":{"cited_paper":"/paper/2409.15637","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:871e3e520cf30052d0a921990bdd4a86b0cb932d03a5aad4532487aa4d23d6a7","observation_id":"c013a0ec-e490-4b2c-ae90-00bfe91b6494","resolution":{"observed_at":"2026-08-12T16:27:47.845089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:47.848946Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.848946Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:4e62d1ef7ad2cd93720b9edf703c24bf33153ae4a4c304d39e4f0904bdab37df","observation_id":"2f1c75ab-32f5-4c34-a7d7-e2a5b06f985e","resolution":{"observed_at":"2026-08-12T16:27:47.848946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:47.852620Z","title":"Alvinn: An autonomous land vehicle in a neural network","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.852620Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:6263c52b04b2baab55790f640a148f617f25cb0197b0d5d6c852a10f0d7aebe6","observation_id":"59bdfd54-f6b7-44b1-b1fb-f21a63d80c70","resolution":{"observed_at":"2026-08-12T16:27:47.852620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:47.856131Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.856131Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:da95be4c8954701103c256b1e8a6d645e8ef9a7958e447f1a0bc79692f3e1ea6","observation_id":"516cfbd9-f719-44ae-8474-c7d5752f0b1b","resolution":{"observed_at":"2026-08-12T16:27:47.856131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:47.859906Z","title":"Recent advances in robot learning from demonstration","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.859906Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:490c611be95633b62da1f4c59930d9400568448afa0321ab4a038b00edd24000","observation_id":"69c55096-7090-46a1-990f-06241076ec99","resolution":{"observed_at":"2026-08-12T16:27:47.859906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12250","last_updated":"2024-05-19T22:44:00Z","snapshot_observed_at":"2026-08-16T13:51:28.987540Z","submitted_at":"2024-05-19T22:44:00Z","title":"Your Transformer is Secretly Linear","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12250","snapshot_observed_at":"2026-08-12T16:27:47.863781Z","title":"Your transformer is secretly linear.arXiv preprint arXiv:2405.12250, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.863781Z"},"links":{"cited_paper":"/paper/2405.12250","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:7c0fee527220eaa07b42fd646c97144d64ceadea133005c9a6db22494d01e2bb","observation_id":"76831047-b8b2-4af4-95d8-c6c1fd10be38","resolution":{"observed_at":"2026-08-12T16:27:47.863781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.394613Z","title":"Generalization guarantees for imitation learning","venue":null,"work_id":"67f7f973-f98b-4190-98a4-8325bab3dc3e","year":2021},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.868558Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:78bed5a9f8233a2a705a76d68905daf6b6f18256c797e1432e6afee402cd3840","observation_id":"a8fcb006-1f57-476a-89eb-2dfa2cdecad6","resolution":{"observed_at":"2026-08-12T16:27:48.399030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:47.872174Z","title":"A reduction of imitation learning and structured prediction to no-regret online learning","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.872174Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:267249b4f6429d58e3ef50ab88af949e0119779464bb6c1950f5eb4ae4af4a95","observation_id":"51c975c7-bf67-4a18-a47f-c11d4dc01d68","resolution":{"observed_at":"2026-08-12T16:27:47.872174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.375579Z","title":"Interactive robot task training through dialog and demonstration","venue":null,"work_id":"4a3dc06e-00c0-46bb-a7a2-2860d6c8fce9","year":2007},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.876142Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:63f9f8b6e8dd766ee99b71040a9c419cb9d97429cb4f18a3e6a5ed37ef798338","observation_id":"6b9138ac-1179-4983-bf04-4413868487db","resolution":{"observed_at":"2026-08-12T16:27:48.379477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:47.879840Z","title":"Learning from demonstration","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.879840Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:681fe1f4dccc2d647309c5857207bcf5a24082db1b47267654d87c625f28369c","observation_id":"7962338e-347c-418f-8d8d-2c0fd27f89f4","resolution":{"observed_at":"2026-08-12T16:27:47.879840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:47.883387Z","title":"Dynamic movement primitives-a framework for motor control in humans and humanoid robotics","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.883387Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:84a12ee99e538f42f108319ef9fc96d77ea573d952c6c37cef23d0ed2928e996","observation_id":"0384e9f0-4689-45f2-ba5b-8a1de1c4a10b","resolution":{"observed_at":"2026-08-12T16:27:47.883387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.349566Z","title":"Evolutionary principles in self-referential learning","venue":null,"work_id":"8c714ea8-cd93-4458-ba0b-ecf1d1c2278d","year":1987},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.887214Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:42f6160c2474e038972442d18c09f7c176ab9902e209b8c28615591f6beaa95b","observation_id":"9f54fd47-c999-4625-be80-0a53131672fd","resolution":{"observed_at":"2026-08-12T16:27:48.353433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-12T16:27:47.890701Z","title":"Quantifying language models’ sensitivity to spurious features in prompt design or: How i learned to start worrying about prompt formatting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.890701Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:90ecc3114275f5e26f8b6e5282399e7a02bdc1c5039babf83524bf8bc104ba36","observation_id":"0a4fd0ef-9e60-46d5-a808-f148bfbb1e3f","resolution":{"observed_at":"2026-08-12T16:27:47.890701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00888","last_updated":"2025-04-18T19:45:34Z","snapshot_observed_at":"2026-08-16T17:37:54.172951Z","submitted_at":"2024-06-02T23:13:56Z","title":"Aligning Language Models with Demonstrated Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00888","snapshot_observed_at":"2026-08-12T16:27:47.894820Z","title":"Show, don’t tell: Aligning language models with demonstrated feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.894820Z"},"links":{"cited_paper":"/paper/2406.00888","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:e5a58a3d2c1df3ee29b930c0776d74cf2b34c561406859d8eca6d37940c045d8","observation_id":"9d7e901c-18fe-46b1-afe1-adae2505ec81","resolution":{"observed_at":"2026-08-12T16:27:47.894820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.338547Z","title":"From pixels to ui actions: Learning to follow instructions via graphical user interfaces, 2023","venue":null,"work_id":"dfb33e4e-baf5-4767-9e2e-886c1ee00790","year":2023},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.899039Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:4d9712a545d2a929eb35afdfcf6db0c698c5ae3c2ee25fa8d1e6637d87774dc6","observation_id":"0d016a49-1904-4c28-823d-18d7f638bacc","resolution":{"observed_at":"2026-08-12T16:27:48.342472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:47.902959Z","title":"World of bits: An open-domain platform for web-based agents","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.902959Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:5dc79bf908129297355bd255789915d64b980a6886fbeabcdbda0f9706c2ca4e","observation_id":"c57e44e5-0813-47b1-9641-28cdc8a39646","resolution":{"observed_at":"2026-08-12T16:27:47.902959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:47.906781Z","title":"Mas- tering the game of go with deep neural networks and tree search","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.906781Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:3479d75abaafa3245d7aa83fbe135bd12cd5366f6809ed98f98f81cc6c84203e","observation_id":"2ef92842-0c88-471d-a13d-6d7d8aa633b8","resolution":{"observed_at":"2026-08-12T16:27:47.906781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16464","last_updated":"2025-06-16T22:23:37Z","snapshot_observed_at":"2026-08-16T13:07:14.222373Z","submitted_at":"2024-10-21T19:46:06Z","title":"Beyond Browsing: API-Based Web Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16464","snapshot_observed_at":"2026-08-12T16:27:47.911411Z","title":"Beyond browsing: Api-based web agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.911411Z"},"links":{"cited_paper":"/paper/2410.16464","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:a3043ff8a7136ea9512c8cdd89d1cc2f73b3d4362ec8877a44b1a86ec4431cfa","observation_id":"6c8b2aa1-93ed-451e-b316-991b8af3b423","resolution":{"observed_at":"2026-08-12T16:27:47.911411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.312690Z","title":"Perception, cognition, and action in teams of robots","venue":null,"work_id":"e9d4f406-11dd-4025-8bce-efa7e1125324","year":2005},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.916436Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:bfee0227821ff979065b0798952fb5f6f1522b1a7289e0317b34bd95551519b2","observation_id":"2a439e34-46d5-400d-9a76-60ae2d227b13","resolution":{"observed_at":"2026-08-12T16:27:48.316680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-12T16:27:47.920413Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.920413Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:4dd929ef2401302c2b02cbed96481a2437bd9996972a0bd034568e1ebaf6e1e5","observation_id":"1767b3c0-e5e6-4c2c-bfd6-305adca70dc8","resolution":{"observed_at":"2026-08-12T16:27:47.920413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.300321Z","title":"Transformers: State- of-the-art natural language processing","venue":null,"work_id":"736c5134-cbd6-4210-b667-a698e0ae33ac","year":2020},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.924639Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:0dc916aca4a0db5b8f20d125f2e3daffce0e74039eb6dc34aa54b41dcae494b7","observation_id":"eb410e8c-32bc-40f7-9df4-0412f7c5431a","resolution":{"observed_at":"2026-08-12T16:27:48.304753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-12T16:27:47.928829Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v.arXiv preprint arXiv:2310.11441, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.928829Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:fa389d4048051b2f3af58967b66b97b5f32324fd1a54a46b82f968bece9e2945","observation_id":"1b2c5ae1-7234-4fb4-82b8-75dad0398fd1","resolution":{"observed_at":"2026-08-12T16:27:47.928829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-12T16:27:47.933320Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.933320Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:e6226d4810570257556d12430408a3a3e12218d6e79d345ba2c7a235b48fe066","observation_id":"772a2a84-c345-4631-9b6e-71ce483761d2","resolution":{"observed_at":"2026-08-12T16:27:47.933320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.287348Z","title":"Selfd: self-learning large-scale driving policies from the web","venue":null,"work_id":"dc066d1f-1b55-4c5d-b9df-da575eb2f7c7","year":2022},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.937628Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:a7642f1d21d4c3d268422f56b4961dbde45d7ce6354afdb40158acdf53282796","observation_id":"8eb4bab8-bd01-4b1b-88f3-8fb586dbd0b3","resolution":{"observed_at":"2026-08-12T16:27:48.292158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11523","last_updated":"2024-10-14T20:02:11Z","snapshot_observed_at":"2026-08-16T14:51:16.052787Z","submitted_at":"2023-10-17T18:41:57Z","title":"Group Preference Optimization: Few-Shot Alignment of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11523","snapshot_observed_at":"2026-08-12T16:27:47.941734Z","title":"Group preference optimization: Few-shot alignment of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.941734Z"},"links":{"cited_paper":"/paper/2310.11523","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:47f40014a6cc0c406fded74f6dd6be77a6a8001ae9c786bf1e7fcfac96e4b23f","observation_id":"677bf8aa-74db-4028-a681-dad0d6b8755c","resolution":{"observed_at":"2026-08-12T16:27:47.941734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:47.946320Z","title":"Gpt-4v(ision) is a generalist web agent, if grounded","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.946320Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:9d1c7a5e8eebe261c14644ddc4107d0d4083dbd40e0f99683be674e9b2adf339","observation_id":"f5ddd3cf-0ac9-4a67-8ccc-b16bb853f23c","resolution":{"observed_at":"2026-08-12T16:27:47.946320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:27:48.265245Z","title":"ideal answers","venue":null,"work_id":"58c7bc42-3b70-4438-ac74-e20ba80130dd","year":2008},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.950451Z"},"links":{"citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:85aabbdd1a8ad0191225cc8562274ac6f2b76d7d24900bcd6b5df37959c40c76","observation_id":"33e426d8-13ea-4add-9539-d3711507e979","resolution":{"observed_at":"2026-08-12T16:27:48.270464Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T12:06:09.194935Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 6 inbound Pith citation observations for arXiv:2411.13451."}