{"as_of":"2026-08-05T23:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:57980f580f2e1b36f9bee82a72b124e7b0de1c603ac4cde5915621057fc10153","coverage":[{"denominator":262,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T04:40:30.985824Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T01:26:13.675678Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.20683","snapshot_observed_at":"2026-07-14T05:52:07.869069Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11399","last_updated":"2026-07-13T11:05:55Z","snapshot_observed_at":"2026-08-05T10:39:24.315775Z","submitted_at":"2026-07-13T11:05:55Z","title":"Agentic Routing: The Harness-Native Data Flywheel","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T05:52:07.869069Z"},"links":{"cited_paper":"/paper/2606.20683","citing_paper":"/paper/2607.11399"},"observation_digest":"sha256:46352a71f8663e6449d80c53e7fa3eb8c42840aa214fbeffdaceb287dbbce20b","observation_id":"087403f3-7980-4924-9b81-ebc7d3ba191c","resolution":{"observed_at":"2026-07-14T05:52:07.869069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.20683","snapshot_observed_at":"2026-08-01T01:26:13.675678Z","title":"arXiv:2606.20683 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25825","last_updated":"2026-07-28T15:06:00Z","snapshot_observed_at":"2026-08-05T18:39:33.325703Z","submitted_at":"2026-07-28T15:06:00Z","title":"CHILL-Harness: Counterfactual Harness Learning for Efficient Reasoning in Long-Horizon Agents","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T01:26:13.675678Z"},"links":{"cited_paper":"/paper/2606.20683","citing_paper":"/paper/2607.25825"},"observation_digest":"sha256:215b1cb2cd1cfd9d85752b342833c241d7e5c51497513ff00fda4ffcd7d0a879","observation_id":"7a01f2f9-db21-4fed-b9cf-05bc136fcd93","resolution":{"observed_at":"2026-08-01T01:26:13.675678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.20683/citation-record","integrity":"/paper/2606.20683/integrity","json":"/paper/2606.20683/citation-record.json","paper":"/paper/2606.20683"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:5d790de47d30a6738b509950ade105d9c17c4c77f93325acfd1692551ef8c30b","observation_id":"58522ca2-8cbd-43b6-af60-cddcf722c9c6","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:91b9f20153094e7208a232c9df3da3f3d88ed137d20224bc7204c4b11f7d4cb5","observation_id":"84375e0d-1b05-49c3-b727-5ffe8ad49c17","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21460","last_updated":"2025-03-27T12:50:17Z","snapshot_observed_at":"2026-07-06T20:59:35.694800Z","submitted_at":"2025-03-27T12:50:17Z","title":"Large Language Model Agent: A Survey on Methodology, Applications and Challenges","version":1},"cited_work":{"arxiv_id":"2503.21460","doi":"10.1145/3573051.3596191","metadata_source":"pith","pith_arxiv_id":"2503.21460","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Model Agent: A Survey on Methodology, Applications and Challenges","venue":"cs.CL","work_id":"4aff48d9-c46d-41d9-904b-52251e559596","year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2503.21460","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:6b5946c3f023dd79ecd958c7684c6418b8a7da2f3ac44544e7dc62e64850c130","observation_id":"1f56010a-5489-44f8-ab7b-b27909e03997","resolution":{"observed_at":"2026-07-03T17:08:43.105689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"The rise and potential of large language model based agents: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:7566a8bb86cde5b7c83f460579694a07a3dfb79caab3013d87163090a51ebd50","observation_id":"6d337973-b161-4fa9-a733-5fc38a523a1a","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Introducing devin, the first AI software engi- neer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:55584b2bbe9c6e823b68b3901dd99d7047a05d3214ad6cbf4e4495becaef91ec","observation_id":"d8a26d76-d63f-49a2-bfb2-db2d5f7046c1","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"How claude code works,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:b71563355d1468171ca2432fb49020f1e4e143428220b1d63fc69c0a9bc4c404","observation_id":"1bd1b179-c552-4a1f-8ee5-4a7a69d09668","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Harness engineering: Leveraging codex in an agent- first world,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:278f00a77b7160607f2964c81ea18828ed10aef0c3ca1a1202b51827537182da","observation_id":"07ef3c0c-9b6e-4abd-9109-071ce6584eec","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02024","last_updated":"2026-07-24T17:29:49Z","snapshot_observed_at":"2026-08-03T22:04:23.607765Z","submitted_at":"2025-05-04T08:24:00Z","title":"From Mind to Machine: The Rise of Manus AI as a Fully Autonomous Digital Agent","version":4},"cited_work":{"arxiv_id":"2505.02024","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02024","snapshot_observed_at":"2026-07-27T02:21:03.069205Z","title":"Shen, M., Li, Y ., Chen, L., and Yang, Q","venue":null,"work_id":"52ba09b0-dde9-45fb-9763-ec9e4aed20ee","year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2505.02024","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:ace6f749668c40e789124dddcacb6d45b0d2a3e65bb0dd704650f6ebc0a1e6c3","observation_id":"d7e47489-82db-4065-a3e0-4fea914af657","resolution":{"observed_at":"2026-07-27T02:21:03.069205Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"AutoGPT,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:3b87047d412e9f1c64fb8a07f719d154cb8234c220e2851e146df797a2dec855","observation_id":"13154711-0fc9-41c4-9ac0-fca12f83d261","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Openhands: An open platform for ai software developers as generalist agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:2468e2566dbda92ef2f8070961f0830f40821c5a84d38ac3666c40c617f6f741","observation_id":"65e619f7-072e-466a-bbb7-36cd89138970","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"OpenClaw: Personal AI assistant,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:dbde4f9b9944dcebb4a57f14abd64af5f6bb2cc794e04f047cb1e57c6f64ba06","observation_id":"8d663ab7-a072-460c-8a22-1c3dab9c01c9","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:d5fd86ce902ecb3d357a95a09bda84ecade4782f26514f49d3eb3e042a078542","observation_id":"26d516e5-be41-4065-97e1-4d19ff11f0c4","resolution":{"observed_at":"2026-07-03T17:08:43.002801Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Gpqa: A graduate-level google-proof q&a benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:edaf164180a2e9df30f5e5b65b28b72243db5c29150218eaf1e2ead7bc9d34d8","observation_id":"834324a1-057a-4481-b9cf-7a13146b37f9","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:2408c256cb5d392cfe1e846ecfbbdcc2a7fad381e55668abc931cbcc67182121","observation_id":"21822162-ffc5-408f-bfb0-a4ea067cb35f","resolution":{"observed_at":"2026-07-03T17:08:43.088024Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":"2501.14249","doi":"10.1038/s41586-025-09962-4","metadata_source":"pith","pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Humanity's Last Exam","venue":"cs.LG","work_id":"59ea00d4-16a8-45e1-aafc-290a6f91d9f4","year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:88aa3e93a46df8fe7f4440780be65343aaa5e3a4dd53592d118891f9fff80aa7","observation_id":"8c647b28-4f5b-4596-a25e-e8d06aae98b6","resolution":{"observed_at":"2026-07-03T16:58:43.696000Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T22:08:32.844211+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T22:08:32.844211+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Swe-bench: Can language models resolve real-world github issues?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:c20ad69d2266f93c7bf06c5d2726346cfd9f2a24b1b001033afefe520f2f45f4","observation_id":"d643b8ee-076a-4272-9ffd-ab8bf7868e2e","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Webarena: A realistic web environ- ment for building autonomous agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:8494fb4908d521b26c824297d1eca1103546f6a90a50fef31575d7afb6999230","observation_id":"19b4ab92-5b53-4124-a1e4-4a0b495f0e84","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Osworld: Benchmarking mul- timodal agents for open-ended tasks in real computer environ- ments,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:8464e918bdb382d9ce6813cbd051abd3ffca60933140f2f497f3b1a77341d29e","observation_id":"f7ab6247-f756-40ee-a44f-8efb31a25971","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Theagent- company: benchmarking llm agents on consequential real world tasks,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:530c9c30d7ac65c78a5dfac0757e22e04fdde6cd87e95fd1fb64240c9b78649d","observation_id":"8168787c-8dcd-4f39-a89d-748b125cc7eb","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":"2601.11868","doi":"10.48550/arxiv.2302.01973","metadata_source":"pith","pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","venue":"cs.SE","work_id":"0624be05-1d97-4fd6-8300-b04b8a3ab04b","year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:192f401c2662fc072790d8a6a175624b9df7dec4d6ba331fe9aaefc6a6378a97","observation_id":"1d814d75-9fb4-44f6-a7b4-8ebd02381387","resolution":{"observed_at":"2026-07-03T16:58:43.713064Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Swe-agent: Agent-computer interfaces enable automated software engineering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:8c9317e9d6c065a1f8c1108f3c01b2f3d25b483ee3462d7e162c51ddec899acc","observation_id":"521d6e99-f4b7-43ba-8367-78101d048baf","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"My AI adoption journey,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:959bd2d8b36c2d83fde0e136804f09f1fe98d03325d5828e3aae1c13b54f00ae","observation_id":"6f7bde6d-8e79-460f-9f7f-daf03a9ae462","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25723","last_updated":"2026-05-18T07:29:29Z","snapshot_observed_at":"2026-08-02T12:44:43.781421Z","submitted_at":"2026-03-26T17:58:15Z","title":"Natural-Language Agent Harnesses","version":2},"cited_work":{"arxiv_id":"2603.25723","doi":"10.48550/arxiv.2603.25723","metadata_source":"pith","pith_arxiv_id":"2603.25723","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Natural-Language Agent Harnesses","venue":"cs.CL","work_id":"9756d161-8a6c-4ba3-8bf8-3af1f9e911d3","year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2603.25723","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:02c1b0985247b0f41a9748e9e70d17e32c6da41f6d50ccd25b53b6cd170a46fd","observation_id":"77a701d5-1f38-4a72-8d6a-2407e755e628","resolution":{"observed_at":"2026-07-03T16:58:43.621297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.28052","last_updated":"2026-03-30T05:33:50Z","snapshot_observed_at":"2026-07-06T22:51:00.579062Z","submitted_at":"2026-03-30T05:33:50Z","title":"Meta-Harness: End-to-End Optimization of Model Harnesses","version":1},"cited_work":{"arxiv_id":"2603.28052","doi":"10.48550/arxiv.2603.28052","metadata_source":"pith","pith_arxiv_id":"2603.28052","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Meta-Harness: End-to-End Optimization of Model Harnesses","venue":"cs.AI","work_id":"5be3c079-4ffa-458f-adcf-204b66f7af51","year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2603.28052","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:fe12f3379d748964958e6c8688fe58fede56668432f3a92057e52f90ad3e0cd3","observation_id":"0b11ae1e-86b3-45e4-8be4-38283a1ebcbf","resolution":{"observed_at":"2026-07-03T16:58:43.738570Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Opensquilla: Token-efficient ai agent with same budget, higher intelligence density,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:06add6457cfe00704cc0415f7c26c9ec5f62ffc58abe67e0e28a1a4922856057","observation_id":"2bd0337b-55d7-49d4-bf87-1713529a3f2d","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:201afec5fe6204221186d040498211744cde46440f53aa079b28d24b534c4070","observation_id":"9768f811-0a2a-4bf3-acc9-57baec4f2e1c","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:c0c9ffacf8da10ce34ff3e41c38d5a4af5be67e5ecdb273589838c3f124b4a2e","observation_id":"c1ef6680-9cd1-42a9-861a-c8ada338e125","resolution":{"observed_at":"2026-07-03T16:58:43.751042Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Tree of thoughts: Deliberate problem solving with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:108404ba915b779965bd6d3b246c4b141eb4468e3494b38672626a7bdf3b8c12","observation_id":"32df21dc-46fa-4c0a-b9e8-a275b1cb56be","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Effective context engineering for AI agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:1addc34f21b105d5630d486b1f7469cc3d7effe89a788cc8e74fe5f934232db7","observation_id":"8a87922a-6235-43d4-b4eb-681aa58bdcc0","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Retrieval- augmented generation for knowledge-intensive nlp tasks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:ec29e55c64a98b95e0ec3d0211eee938e695dc2b6ee734aad98bfd304d9c3511","observation_id":"a66276ae-5cb7-4df7-8376-27278800f95e","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Memgpt: towards llms as operating systems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:8137384c676623ed2a640abb10c6505380532eabf67c875aa2514deb8ae2b7f2","observation_id":"b971c240-1bd1-4be4-94db-ef401d132c94","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Tool- former: Language models can teach themselves to use tools,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:581b11f3cac9aaea83f1845a1e7b6710c3ce4f92b42308a1727985e9c7719c0c","observation_id":"1feae89a-2ef6-4092-9576-a6bc02330997","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Gorilla: Large language model connected with massive apis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:1b7253457167999b06a77be3f7323a86319c2271b38cd38095e6b419d53fb75d","observation_id":"161f824f-295e-4aeb-964d-2285f960c3ed","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":"2305.16291","doi":"10.18653/v1/2023.emnlp-main.118","metadata_source":"pith","pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","venue":"cs.AI","work_id":"ffe0d207-86cf-4742-a100-e988ac8b9676","year":2023},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:1ac6023faeea82155ef5406fa217232c1bf8c95660c89385b57676636f7e83d4","observation_id":"4b2fe69c-c9ce-4e1f-a710-226782561abc","resolution":{"observed_at":"2026-07-03T16:58:43.667693Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12430","last_updated":"2026-06-02T16:14:54Z","snapshot_observed_at":"2026-08-02T23:50:43.512282Z","submitted_at":"2026-02-12T21:33:25Z","title":"Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward","version":4},"cited_work":{"arxiv_id":"2602.12430","doi":"10.48550/arxiv.2602.12430","metadata_source":"pith","pith_arxiv_id":"2602.12430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward","venue":"cs.MA","work_id":"a64d3985-6826-492c-8a2e-f0965d805bfd","year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2602.12430","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:107a72b2b26a136a3dbcbb01f0b10830609c958d016298e8bff9b9d7327d77fc","observation_id":"62d12a83-18ab-4397-9b48-5edda27848d9","resolution":{"observed_at":"2026-07-03T17:08:42.991675Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":"2210.03629","doi":"10.48550/arxiv.2210.03629","metadata_source":"pith","pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","venue":"cs.CL","work_id":"407a2351-25f1-497d-b611-f77d0292a8e6","year":2022},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:65ef60d366abf35caa594c20b54a84e8c623800381a13dc76f3e91a989840fb2","observation_id":"c2b073f3-6b79-46b8-a6fb-ba11c55bd5d0","resolution":{"observed_at":"2026-07-03T16:58:43.706847Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:36.897515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:36.897515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04468","last_updated":"2024-11-07T06:36:19Z","snapshot_observed_at":"2026-08-04T17:52:28.620519Z","submitted_at":"2024-11-07T06:36:19Z","title":"Magentic-One: A Generalist Multi-Agent System for Solving Complex Tasks","version":1},"cited_work":{"arxiv_id":"2411.04468","doi":"10.48550/arxiv.2411.04468","metadata_source":"pith","pith_arxiv_id":"2411.04468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Magentic-One: A Generalist Multi-Agent System for Solving Complex Tasks","venue":"cs.AI","work_id":"7041cf9c-a528-465d-8bec-028e02e47d3d","year":2024},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2411.04468","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:73253d74372fe7d1c74b66beb5a72d477b8127bcbf9c3ac1285f5a62f12e73b1","observation_id":"2b5d062b-464f-4662-93d3-65de195676a6","resolution":{"observed_at":"2026-07-03T16:58:43.628288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T18:52:14.738339+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T18:52:14.738339+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.22623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:58:43.632686Z","title":"Symphony: Synergistic multi-agent planning with heterogeneous language model assembly,","venue":null,"work_id":"c8d7b3cc-42c6-4dbd-bff0-25c798800426","year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:163c611820a59706995e830ce9a801c5e8d2aa1937535344bcf871e85b0da37a","observation_id":"c9fa01c1-68fd-4d4d-bc36-3df0351a7c1a","resolution":{"observed_at":"2026-07-03T16:58:43.634674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Openai agents sdk,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:16cb69889ec48be52cc3fc7b03c6bde68a0f9445ad13528e21036b20ce5d5ef3","observation_id":"a49b79f7-9de0-44ac-839f-e4964bff13d6","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.25850","last_updated":"2026-05-18T15:11:47Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T16:55:02Z","title":"Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses","version":4},"cited_work":{"arxiv_id":"2604.25850","doi":"10.48550/arxiv.2604.25850","metadata_source":"pith","pith_arxiv_id":"2604.25850","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses","venue":"cs.CL","work_id":"207d40bc-1c5c-4a3b-97ec-547023798f8a","year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2604.25850","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:0c6383ff4600448278842d1cf127280cb55e775c9a9513e2aef547d7b33b2058","observation_id":"954da0f9-8ef0-4a53-8d57-0e481a8bfacf","resolution":{"observed_at":"2026-07-03T17:08:43.000167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:50:59.364676+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:50:59.364676+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Webrl: Training llm web agents via self- evolving online curriculum reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:6fb62b17d4a934a93e18b8d9e1808c94d359ad93147a8d6946743d6c67a5a934","observation_id":"6b6f64c2-519b-438b-a0dd-300b98840a08","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.14040","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T10:59:46.536138Z","title":"Computerrl: Scaling end-to-end online reinforcement learning for computer use agents","venue":null,"work_id":"cd9d7458-2a31-46a9-9107-77d316195b49","year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:d1639a77df58ef95d505aa443176564d74f94c919f9ac43d20aba7b19382c52e","observation_id":"5eccc082-9038-474f-867b-4b1859a9e440","resolution":{"observed_at":"2026-07-03T16:58:43.761088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:97864ee5ad18f9eb6e0deb597f1a062da067e5bfa11dc24f1ffdfe76ce84d864","observation_id":"bbc10a30-eb7b-4656-8f72-24d6933ba2e5","resolution":{"observed_at":"2026-07-03T17:08:43.133784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.16079","last_updated":"2026-05-16T02:57:47Z","snapshot_observed_at":"2026-08-05T00:54:36.690304Z","submitted_at":"2025-10-17T12:03:16Z","title":"EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle","version":3},"cited_work":{"arxiv_id":"2510.16079","doi":"10.48550/arxiv.2510.16079","metadata_source":"pith","pith_arxiv_id":"2510.16079","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EvolveR: Self-Evolving LLM Agents through an Experience-Driven Lifecycle","venue":"cs.CL","work_id":"350af93c-7749-4477-8163-e35d2cac8d96","year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2510.16079","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:1d6e3c288c2e3aa261c37b07e3f266868bf123bdbb3119fe0de58258aa7ecf50","observation_id":"9140a3cb-c0db-4691-9c49-8bbc9b641215","resolution":{"observed_at":"2026-07-03T16:58:43.731204Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.10395","doi":"10.48550/arxiv.2511.10395","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentevolver: Towards efficient self-evolving agent system","venue":"ArXiv.org","work_id":"e9710c06-579f-415b-88ba-965ce465b757","year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:8eea77e7a24d5888157c8599cee8781d0ccefa46e7e94b373b994649ae540aa5","observation_id":"656ff691-5abf-4439-b74e-83916829252d","resolution":{"observed_at":"2026-07-03T16:58:43.803376Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22954","last_updated":"2026-03-12T23:47:40Z","snapshot_observed_at":"2026-07-06T21:32:33.515702Z","submitted_at":"2025-05-29T00:26:15Z","title":"Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents","version":3},"cited_work":{"arxiv_id":"2505.22954","doi":"10.48550/arxiv.2505.22954","metadata_source":"pith","pith_arxiv_id":"2505.22954","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents","venue":"cs.AI","work_id":"c0d964a0-02a1-4ee2-a596-028489ba753f","year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2505.22954","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:fec6476e83abde1367f0b7b687da31c27424d3bae0bcc34d1e6ddeeb75e13867","observation_id":"267608f2-640a-4f2f-8151-81e258f4d3a2","resolution":{"observed_at":"2026-07-03T16:58:43.781281Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:19.626419+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:19.626419+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"A survey on large language model based autonomous agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:0934d355a39102c3e41d773c01988a22b3a5921305c49baea99d8762240671fe","observation_id":"e89abc72-ac39-4b02-b00e-c3f11b83290a","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01680","last_updated":"2024-04-19T01:15:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-21T23:36:14Z","title":"Large Language Model based Multi-Agents: A Survey of Progress and Challenges","version":2},"cited_work":{"arxiv_id":"2402.01680","doi":"10.48550/arxiv.2402.01680","metadata_source":"pith","pith_arxiv_id":"2402.01680","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Model based Multi-Agents: A Survey of Progress and Challenges","venue":"cs.CL","work_id":"fb905249-ea5f-4765-80f0-2428ea66f15f","year":2024},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2402.01680","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:dc0d6d2332fe797f4db593ffeb285bbc5ee017a078293d344816610f5bc0f21d","observation_id":"f94880c6-3f83-4f45-9173-3a33cda34c65","resolution":{"observed_at":"2026-07-03T16:58:43.678082Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"A survey on llm-based multi-agent systems: workflow, infrastructure, and challenges,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:d5b7895c6d016d84dda2e7608865f789683b24519c14dda581e7c2ad264b940b","observation_id":"4a9c5609-b8df-4a86-8735-a48437171287","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06322","last_updated":"2025-01-10T19:56:50Z","snapshot_observed_at":"2026-07-30T22:07:13.869232Z","submitted_at":"2025-01-10T19:56:50Z","title":"Multi-Agent Collaboration Mechanisms: A Survey of LLMs","version":1},"cited_work":{"arxiv_id":"2501.06322","doi":"10.48550/arxiv.2501.06322","metadata_source":"pith","pith_arxiv_id":"2501.06322","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multi-Agent Collaboration Mechanisms: A Survey of LLMs","venue":"cs.AI","work_id":"34627f75-81fe-465e-bca5-d2a93270aa1d","year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2501.06322","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:c563491beaf4c987886de89d875f06db969fe4b435c7a118267b43a9e38f5c6e","observation_id":"617ff05e-458b-43d2-9771-6c5d98faa7e2","resolution":{"observed_at":"2026-07-03T16:58:43.775282Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:24.614742+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:24.614742+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16416","last_updated":"2026-04-23T17:36:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-20T17:59:23Z","title":"Survey on Evaluation of LLM-based Agents","version":2},"cited_work":{"arxiv_id":"2503.16416","doi":"10.48550/arxiv.2503.16416","metadata_source":"pith","pith_arxiv_id":"2503.16416","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Survey on Evaluation of LLM-based Agents","venue":"cs.AI","work_id":"d9ac1186-88b1-41bd-9bc7-8a0b87e6f305","year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2503.16416","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:fa9121928777d4fdd52779b25e5e88c9eeaeedb0c929f7de8d6fad1adcd339f6","observation_id":"c73ff787-acee-40a5-a6c5-db91920974d0","resolution":{"observed_at":"2026-07-03T16:58:43.696328Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T06:20:44.248546+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T06:20:44.248546+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Gui agents: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:74e2e13c87e8f16ac321c63e504efa6a3b2e5d1bc068ddd15ffc395499663213","observation_id":"f1cbdb79-344f-42bb-ada9-4c10634f1dfa","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"A survey on vision–language–action models for embodied ai,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:913f19a8672c162e35601390a2215ad02d08dc69e1fa813291f57ae59e501291","observation_id":"0255382f-ad9f-4775-920e-01382c99af3f","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"A survey on trustworthy llm agents: Threats and countermeasures,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:fcc6ca37b8868da2d4cc7de537e88bb6262d21d4f60c41dde560f880a9e31f5f","observation_id":"eacbeaa1-da2a-48f6-9c17-72f0b7abe9ee","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Agent harness for large language model agents: A survey,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:94cb5106c1e9b15c69a3f25b802a53ebadf09be5ed65f365b06d556ac329b487","observation_id":"5e6b76a6-0222-4123-a575-23ea398d4538","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Agent harness engineering: A survey,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:6c8972c22fccdc79df3e191d978e9e58f389975f14461b74fdaf45064c7f94b7","observation_id":"1620c548-dc2b-4c75-b075-6a6a3ff5b89d","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18747","last_updated":"2026-05-18T17:59:03Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:59:03Z","title":"Code as Agent Harness","version":1},"cited_work":{"arxiv_id":"2605.18747","doi":"10.48550/arxiv.2605.18747","metadata_source":"pith","pith_arxiv_id":"2605.18747","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Code as Agent Harness","venue":"cs.CL","work_id":"37bdf317-af61-48e1-9225-d6e14b264a37","year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2605.18747","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:d0db85f8a3fa12d4e8d45d575b94f0763185692339740ae77b2488e42dc28690","observation_id":"3e80f71d-1931-439a-aa86-1564d9108f4e","resolution":{"observed_at":"2026-07-03T16:58:43.795053Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Intelligent agents: Theory and practice,","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:4f5da123dea1afd947e5704ca493941eaebec9983b8e52490e6fcc36d21915ac","observation_id":"d868f062-685e-4f3e-9fb7-d96566eae302","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Generative agents: Interactive simulacra of human behavior,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:c7feffbecd21af1e4d3ba0c19eb3c86396586e8c98d862e37db8586ce75e5281","observation_id":"6e4db965-2259-4c50-aedd-057ea2bc9829","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Autogen: Enabling next-gen llm applications via multi-agent conversations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:b14bc0e09defeb48138368f730c444d3adb11735d319d413fe9ca33081a4cb73","observation_id":"fd226497-8354-4536-89f0-e626392271b3","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Metagpt: Meta program- ming for a multi-agent collaborative framework,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:b3a2ed45cac446578f4bf84525a9104db99e6dbb35a2cdecff0acab8e21fce03","observation_id":"ad1450e7-7528-48d7-a368-a23b2f87fb9e","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08291","last_updated":"2023-05-15T01:18:23Z","snapshot_observed_at":"2026-07-06T15:27:02.376191Z","submitted_at":"2023-05-15T01:18:23Z","title":"Large Language Model Guided Tree-of-Thought","version":1},"cited_work":{"arxiv_id":"2305.08291","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.08291","snapshot_observed_at":"2026-07-03T16:58:43.776928Z","title":"In The Twelfth Inter- national Conference on Learning Representations","venue":null,"work_id":"8f510da6-cbb6-4f62-a6bb-2d311d7bbd4c","year":2023},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2305.08291","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:add8640d0ead30f469d554af0a580409a8cc545a5d1ae4245073f7703da59492","observation_id":"67030b78-f4f4-45e7-b26c-1198c43532c5","resolution":{"observed_at":"2026-07-03T16:58:43.778580Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Reflexion: Language agents with verbal reinforcement learn- ing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:011cc4b7ee7eaa1e2cd6e7849f4722014cabdac5e262b9f4be804e3b2fde595f","observation_id":"c1fa79df-c795-43fb-a389-00cb84ca9e8e","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Effective harnesses for long-running agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:3258eafaaa10740f553585a951e0693a7f187ce8c088a30b04d04f31cfd954fb","observation_id":"da3996db-0864-46d5-9637-a2060a4ae770","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Model context protocol,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:09313f638da508120c6972265e6b68f77c94cfcff733cc3c248e066d9163c289","observation_id":"1973f008-0aa1-4e98-ba92-cae7da844925","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Agent2agent (a2a,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:6a27ad1fb4261fa9db43b688d40261dab44d9e909de72dd62db03dce46322b88","observation_id":"4c8f12d8-5955-4fff-a7c1-4b18b844749c","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:f2c252bd5be1aa8cdd85dc8db07fca8c69ec19f3407bbb59fa607986fceb5f66","observation_id":"c02c64d9-4009-46e6-8afd-5c84e1249e2b","resolution":{"observed_at":"2026-07-03T16:58:43.815033Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:c72699fb314e4c9c2e9ed1aa4e3cf8d33e7abeba295731e850ef0e5cd2448c57","observation_id":"dce5347d-ed9b-4f6c-b930-e6c4a41481b0","resolution":{"observed_at":"2026-07-03T16:58:43.830684Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Palm: Scaling language modeling with pathways,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:5dcc56a2e97b2d65e34dc2806cd1d4cd87dba9ec19bcf96b3d703cbe4da92536","observation_id":"d0f0ebe8-85a9-4a7e-95a2-209005b0d666","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13474","last_updated":"2023-02-27T21:26:48Z","snapshot_observed_at":"2026-07-06T12:52:16.992962Z","submitted_at":"2022-03-25T06:55:15Z","title":"CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis","version":5},"cited_work":{"arxiv_id":"2203.13474","doi":"10.48550/arxiv.2203.13474","metadata_source":"pith","pith_arxiv_id":"2203.13474","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis","venue":"cs.LG","work_id":"892a192d-205a-4079-a807-00d7874b392e","year":2022},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2203.13474","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:d5ce43f73d21cb6b7754362d8f55f80f031acb099dd6b0055c3f9204ae3f0283","observation_id":"6d068976-249f-46a6-9d82-e7b08b33b53d","resolution":{"observed_at":"2026-07-03T16:58:43.821874Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Competition- level code generation with alphacode,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:730dfc34b31f35f152d282ba4dc4f1b1d56ff98e494b5f9949abe5265a6f7f4f","observation_id":"c291034b-5bbf-41b9-98bd-93e53b508a7f","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Solving quantitative reasoning problems with language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:5a2596af3f5aa9a75cba45a671ba19ca5f00a4b63acc997bd743719e7c14b544","observation_id":"7bce9e6b-38eb-4c3d-bfca-7320cd8a2a1e","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:de0315a1fa1f5ad25cb516fcd6bd7842d2d1f357ff6def3a278e91c1cb0de27a","observation_id":"dbbb5c0a-109d-40dd-b2a6-25a4c0e4f22d","resolution":{"observed_at":"2026-07-03T17:08:43.005095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:a04b1987ff4524c176e58ab1ec5a2accacab81c579b20a17d47890bc89a97cea","observation_id":"f8ae1ce5-1a50-4841-bdd1-676e6dc99775","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"On scaling up a multilingual vision and language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:efc721683e3987fbc40a0463519e0ee4e677d33094dd64c8f1cd6fc2b9cf0b53","observation_id":"973f9e5a-d86a-4d96-9929-a772141f0c8d","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:ddd5a3d5c17923f207b0805bf75a1e257530cc7a9d9a334d263b63c184d32bae","observation_id":"492317bc-ec71-4ddd-967d-7dcd9928752c","resolution":{"observed_at":"2026-07-03T16:58:43.707231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Is your code generated by chatgpt really correct? rigorous evaluation of large language models for code generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:7183a184b2384fdd84bcb5986a91647574e3af411af68221f5c93b69d09ef22c","observation_id":"e85f5e49-d91c-4d2e-9bde-4b9cf058639d","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:806e6d256015709df61384134b0addb448c6e395e0757255387ad37086a3b411","observation_id":"422b7c19-2d82-4e9d-ac15-fc683857f187","resolution":{"observed_at":"2026-07-03T17:08:43.127363Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:475d5b4d08c14b79f31a6c4d9b16fc4f49d92913752d061388c3760fd54f5dee","observation_id":"c774dae3-fe47-4753-87d5-de8746833a9d","resolution":{"observed_at":"2026-07-03T16:58:43.651190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:a2a593dbe7ad3a3d397ce1a6d22beb35f5fe608bc3453ac7b4b3179656cf4d92","observation_id":"0708e5e6-04e4-45f9-bcbf-ac4253b0cf08","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:e51b47cd03e26215d794c5c412ae22606e1b85e3d3a284ea501147a67d431948","observation_id":"6922a4f7-237f-4cdd-9f10-0cc171491814","resolution":{"observed_at":"2026-07-03T17:08:43.110700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Mmlu-pro leaderboard,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:e43d34cbbf443dfc04efc4c4b083ccb809454f8606cb56cd0db5321137749a06","observation_id":"f66724d2-7d98-4caa-aa93-3762c17c51c4","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Gpqa diamond,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:d77dababbd9e4aec71169cf457f90b1677adb1b093603d3ea7d004660a753fcb","observation_id":"086b54b9-1847-40c9-8c16-fa5728db1ada","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.09447","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:58:43.796355Z","title":"Swe-agi: Benchmarking specification-driven software construction with moonbit in the era of autonomous agents,","venue":null,"work_id":"bbbd9032-c48c-45c5-9b9d-4e6790a82080","year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:0b83d22ba07a605da07c3bbc4fc864c70f5c810c9430b901f02927168725519d","observation_id":"f8040ee2-01c4-48d0-bf21-0555f37aced1","resolution":{"observed_at":"2026-07-03T16:58:43.797876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02995","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:09:57.360937Z","title":"Agent alpha: Tree search unifying generation, exploration and evaluation for computer-use agents.arXiv preprint arXiv:2602.02995","venue":null,"work_id":"88cbdc5d-0e07-4c4b-a64c-3b79bf266bab","year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:961428055daa1ceefd6b903b4d6fe68a82ee22b83a4a31d04f2618be4dbe4099","observation_id":"485faf96-3d5b-4266-97c9-fba29254ea2c","resolution":{"observed_at":"2026-07-03T16:58:43.647753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.10975","doi":"10.48550/arxiv.2602.10975","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Featurebench: Benchmarking agentic coding for complex feature development","venue":"Open MIND","work_id":"b018156c-79c6-4598-ab07-bbbd49818525","year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:db2f4270f0c723857b7772bc3fbd17a2d974fb21566d2bad6ade65e1f5893767","observation_id":"7509f3b5-37b6-4ca6-a6fe-5565dbdb3c74","resolution":{"observed_at":"2026-07-03T16:58:43.775222Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Turkingbench: A challenge benchmark for web agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:fae28a24031c84132c78db5597a3039ff0aac5ddabda9cf1885f2f4fff68f69c","observation_id":"6b4ebee3-bdb7-4bc6-ab9b-9971ece962eb","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07919","last_updated":"2025-07-24T17:45:05Z","snapshot_observed_at":"2026-07-06T20:50:19.098219Z","submitted_at":"2025-03-10T23:50:30Z","title":"BEARCUBS: A benchmark for computer-using web agents","version":3},"cited_work":{"arxiv_id":"2503.07919","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.07919","snapshot_observed_at":"2026-07-08T16:15:06.192914Z","title":"Bearcubs: A benchmark for computer-using web agents","venue":"cs.AI","work_id":"cea96bfb-b39d-4c27-9c28-d03836ce5aeb","year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2503.07919","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:797bc5f070957a7e276bfe00e8b4626786d18217794999ea1c81210237c57020","observation_id":"3aaa97ae-6aad-4122-b007-25f78e8c8e9a","resolution":{"observed_at":"2026-07-03T17:08:43.103294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09321","last_updated":"2025-09-11T10:10:48Z","snapshot_observed_at":"2026-08-04T19:21:20.237840Z","submitted_at":"2025-09-11T10:10:48Z","title":"Towards Adaptive ML Benchmarks: Web-Agent-Driven Construction, Domain Expansion, and Metric Optimization","version":1},"cited_work":{"arxiv_id":"2509.09321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.09321","snapshot_observed_at":"2026-07-03T17:08:43.128824Z","title":"To- wards adaptive ml benchmarks: Web-agent-driven construction, domain expansion, and metric optimization,","venue":null,"work_id":"85a48350-374a-4ae1-b6b8-a9bbe0db4b6f","year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2509.09321","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:2a612e2813b9a3a26f0f9fa85fa9388fc33f97302f1b0f4abeacff63507290c4","observation_id":"ac74188f-114d-418d-97c0-6dd30932082b","resolution":{"observed_at":"2026-07-03T17:08:43.130648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.23729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:58:43.698081Z","title":"From static benchmarks to dynamic protocol: Agent-centric text anomaly detection for evaluating llm reasoning,","venue":null,"work_id":"09ae38f9-041a-4dc9-a75f-434132d2ac81","year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:222eb20b157bced26091b91b321f0800a218acf993e0e378540fc5d7411f75fa","observation_id":"40db96f3-0a1a-401d-a8c0-6d6043db88c4","resolution":{"observed_at":"2026-07-03T16:58:43.699744Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.00468","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T17:08:43.104145Z","title":"Cloud-OpsBench: A Reproducible Benchmark for Agentic Root Cause Analysis in Cloud Systems","venue":null,"work_id":"00b5f6f2-b33f-43b7-b799-dcbbdd8ebebe","year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:5ffda3423abc4f680a2dbe0fa9d399a33c2599419c4e23e0b4989405279cc142","observation_id":"e5bf09db-3a17-41bc-8e65-5820ee021d31","resolution":{"observed_at":"2026-07-03T17:08:43.105600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Bigcodebench: Benchmarking code generation with diverse function calls and complex instructions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:7426d25fd0d81421c82546ebbe2c9c17ff0e73d61d8c38ac0c7458e7299b133f","observation_id":"81527069-bfad-4aa6-ac4c-909ebab6d78e","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13072","last_updated":"2026-06-25T07:57:24Z","snapshot_observed_at":"2026-08-01T21:30:59.499457Z","submitted_at":"2026-03-20T16:08:21Z","title":"LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks","version":2},"cited_work":{"arxiv_id":"2604.13072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13072","snapshot_observed_at":"2026-07-10T01:46:41.280088Z","title":"LiveClawBench: Benchmarking LLM Agents on Complex, Real-World Assistant Tasks","venue":"cs.CL","work_id":"10b104ad-6626-42e2-92b8-8ff6f4d02857","year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2604.13072","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:474fe26e3509a4fd052652a287826e059638ef5c04c83a45b7b043549cf7a863","observation_id":"84d3d853-fdda-40c0-824f-6e3ef8ddaca6","resolution":{"observed_at":"2026-07-03T16:58:43.763767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Multichallenge: A realistic multi-turn conversation evaluation benchmark challenging to frontier llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:de6ec30b9b823f76afdf56aaba7927df99915147664d2d8f4d0d0e427f111f0c","observation_id":"5dfc95db-f400-4807-a57c-b309d5bdc2bf","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14499","last_updated":"2026-07-10T21:48:09Z","snapshot_observed_at":"2026-08-01T19:38:55.929115Z","submitted_at":"2025-03-18T17:59:31Z","title":"Measuring AI Ability to Complete Long Software Tasks","version":4},"cited_work":{"arxiv_id":"2503.14499","doi":"10.48550/arxiv.2503.14499","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.14499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robert Tjarko Lange, Yuki Imajuku, and Edoardo Cetin","venue":"arXiv (Cornell University)","work_id":"37da2963-7822-4d51-9aa5-d4a11d757e36","year":2025},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2503.14499","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:8816d3d991d7281a5ad3e10d7e6b5bd328b60d107f8f6659149cadf0ebc48db6","observation_id":"07c2dd7c-4756-4de7-8b88-a6f35787d7dd","resolution":{"observed_at":"2026-07-14T01:19:52.953392Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Large language models are zero-shot reasoners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:2e3a36b1f3ac08d9c0327232e0f120f46850bc77459659b05908766a4c7e530e","observation_id":"b77ef95e-190c-4ea5-a174-65dfb78e7baa","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T04:40:30.985824Z","title":"Self-refine: Iterative refinement with self-feedback,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:dd50c15fd21ba1a5457a4637b1898e2de6325a0aca1db9901ace5410980ce77c","observation_id":"a4975686-e876-471d-b4aa-8b5db4e1be24","resolution":{"observed_at":"2026-06-27T04:40:30.985824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07927","last_updated":"2025-03-16T06:23:34Z","snapshot_observed_at":"2026-08-05T17:55:26.008016Z","submitted_at":"2024-02-05T19:49:13Z","title":"A Systematic Survey of Prompt Engineering in Large Language Models: Techniques and Applications","version":2},"cited_work":{"arxiv_id":"2402.07927","doi":"10.1145/3658644.3670388","metadata_source":"pith","pith_arxiv_id":"2402.07927","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Systematic Survey of Prompt Engineering in Large Language Models: Techniques and Applications","venue":"cs.AI","work_id":"83d5f1d1-b40d-49c8-9770-6c57bed8a8b8","year":2024},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"cited_paper":"/paper/2402.07927","citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:154d4479ed21ecd74a7347f5c3a159e3cc5ae9dfb47b946abb046d8e564a07e2","observation_id":"318cc1cc-0f55-434a-9d44-4a811e21d98e","resolution":{"observed_at":"2026-07-03T16:58:43.728078Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.14703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T17:08:43.091582Z","title":"Beyond local code optimization: Multi-agent reasoning for software system optimization,","venue":null,"work_id":"8957eb92-53bd-4f55-84a8-ed230f3d27a3","year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:191daa39d33adb1c393fcc922cbbb805f0e7b90a4f51431ea114b1d9fbfde0a1","observation_id":"e0831e76-4b1f-42f6-8f1c-ae352711b84a","resolution":{"observed_at":"2026-07-03T17:08:43.095933Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.11082","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:58:43.734013Z","title":"Quality-driven agentic reasoning for llm-assisted software design: Questions-of-thoughts (qot) as a time-series self-qa chain,","venue":null,"work_id":"f6ebc2ef-83fa-4c8b-8520-d1a0c67dcb8c","year":2026},"citing_paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-06-27T04:40:30.985824Z"},"links":{"citing_paper":"/paper/2606.20683"},"observation_digest":"sha256:037bd30909f31a65ea13710c011f0a6b6715b3959be8d34e096ef88274776be5","observation_id":"dc56c47b-e22a-420e-966c-709baa889a58","resolution":{"observed_at":"2026-07-03T16:58:43.735722Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.20683","last_updated":"2026-06-14T05:40:16Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-30T16:44:18.366904Z","submitted_at":"2026-06-14T05:40:16Z","title":"From Question Answering to Task Completion: A Survey on Agent System and Harness Design"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":55,"verified_exact":42,"verified_fuzzy":0},"total_outbound_references":262},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 262 outbound references and 2 inbound Pith citation observations for arXiv:2606.20683."}