{"as_of":"2026-08-04T06:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:47e38d513f33fadf8348509c13630e9bd7ada9cea41058e368d2bebdfd2c44c4","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-07T05:10:58.065201Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T00:25:08.066021Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.28093","last_updated":"2026-04-30T16:37:37Z","snapshot_observed_at":"2026-08-03T09:03:06.300260Z","submitted_at":"2026-04-30T16:37:37Z","title":"What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.28093","snapshot_observed_at":"2026-08-03T00:25:08.066021Z","title":"arXiv preprint arXiv:2604.28093 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28802","last_updated":"2026-07-30T19:55:14Z","snapshot_observed_at":"2026-08-04T06:26:11.908981Z","submitted_at":"2026-07-30T19:55:14Z","title":"Model or Harness? An Interaction-Centric Taxonomy for Localizing Agent Failures","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T00:25:08.066021Z"},"links":{"cited_paper":"/paper/2604.28093","citing_paper":"/paper/2607.28802"},"observation_digest":"sha256:5541cdb07747a6faa1d979a4ad125e07b1191f5e39a1811dccc87a0b1ccd5f63","observation_id":"03c64f5c-1682-4b91-a664-c94a02a0bffa","resolution":{"observed_at":"2026-08-03T00:25:08.066021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.28093/citation-record","integrity":"/paper/2604.28093/integrity","json":"/paper/2604.28093/citation-record.json","paper":"/paper/2604.28093"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":"1606.06565","doi":"10.48550/arxiv.1606.06565","metadata_source":"pith","pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Concrete Problems in AI Safety","venue":"cs.AI","work_id":"c8d14fbe-6eab-464a-95b3-778aabd82fa3","year":2016},"citing_paper":{"arxiv_id":"2604.28093","last_updated":"2026-04-30T16:37:37Z","snapshot_observed_at":"2026-08-03T09:03:06.300260Z","submitted_at":"2026-04-30T16:37:37Z","title":"What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-07T05:10:58.065201Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2604.28093"},"observation_digest":"sha256:ef6bc499b2157cd51e10c3f8e794ddd1708036da9ce0f5783653bae53a7c0af2","observation_id":"433f73ab-51e8-409d-8b71-d0aea40d42b2","resolution":{"observed_at":"2026-05-12T10:36:30.967971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:49:52.215761+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:49:52.215761+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.17596","last_updated":"2026-04-19T20:04:02Z","snapshot_observed_at":"2026-07-06T23:04:41.564912Z","submitted_at":"2026-04-19T20:04:02Z","title":"Terminal Wrench: A Dataset of 331 Reward-Hackable Environments and 3,632 Exploit Trajectories","version":1},"cited_work":{"arxiv_id":"2604.17596","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.17596","snapshot_observed_at":"2026-07-03T00:17:29.169141Z","title":"Terminal Wrench: A Dataset of 331 Reward-Hackable Environments and 3,632 Exploit Trajectories","venue":"cs.CR","work_id":"ade05ec7-e557-4a99-892c-be73d02525d5","year":2026},"citing_paper":{"arxiv_id":"2604.28093","last_updated":"2026-04-30T16:37:37Z","snapshot_observed_at":"2026-08-03T09:03:06.300260Z","submitted_at":"2026-04-30T16:37:37Z","title":"What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-07T05:10:58.065201Z"},"links":{"cited_paper":"/paper/2604.17596","citing_paper":"/paper/2604.28093"},"observation_digest":"sha256:07e9fc2ce2f6de287d2af3d54d85c4fab594aea0ac77f17c8de79c679203550b","observation_id":"b94a18b1-ec0b-404f-afae-70e1f4292d29","resolution":{"observed_at":"2026-05-12T10:36:30.961371Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"91f28522-7c13-4942-91b6-972b1daddb29","year":2025},"citing_paper":{"arxiv_id":"2604.28093","last_updated":"2026-04-30T16:37:37Z","snapshot_observed_at":"2026-08-03T09:03:06.300260Z","submitted_at":"2026-04-30T16:37:37Z","title":"What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-07T05:10:58.065201Z"},"links":{"citing_paper":"/paper/2604.28093"},"observation_digest":"sha256:0a4c3b911180441e7ba5a91c9a6caab8c38abbe503fcf3d6cca9f88c3679b974","observation_id":"7bd7c221-8fb6-484a-97c1-c3ecd34cc25f","resolution":{"observed_at":"2026-05-27T10:49:02.977699Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dell’Acqua, E","venue":null,"work_id":"a0eb0c93-4c20-410e-b81f-89cdfda1fb30","year":2023},"citing_paper":{"arxiv_id":"2604.28093","last_updated":"2026-04-30T16:37:37Z","snapshot_observed_at":"2026-08-03T09:03:06.300260Z","submitted_at":"2026-04-30T16:37:37Z","title":"What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T05:10:58.065201Z"},"links":{"citing_paper":"/paper/2604.28093"},"observation_digest":"sha256:d98d4caa99dc69fd2783284c6e8204ea99de7dcfd90979cb1c4769ceb1c018fd","observation_id":"4d46291f-fd14-46bd-8ccb-5e1e21ef324d","resolution":{"observed_at":"2026-05-27T10:49:02.983915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10162","last_updated":"2024-06-29T00:28:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-14T16:26:20Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.10162","doi":"10.48550/arxiv.2406.10162","metadata_source":"pith","pith_arxiv_id":"2406.10162","snapshot_observed_at":"2026-07-10T11:57:03.262704Z","title":"Sycophancy to Subterfuge: Investigating Reward-Tampering in Large Language Models","venue":"cs.AI","work_id":"014812eb-baf1-4420-a49e-8896a973e595","year":2024},"citing_paper":{"arxiv_id":"2604.28093","last_updated":"2026-04-30T16:37:37Z","snapshot_observed_at":"2026-08-03T09:03:06.300260Z","submitted_at":"2026-04-30T16:37:37Z","title":"What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-07T05:10:58.065201Z"},"links":{"cited_paper":"/paper/2406.10162","citing_paper":"/paper/2604.28093"},"observation_digest":"sha256:fa2fcb8a8ab06dfffb939315067b3db2d2501974650a694ea4fb1e2652981ae7","observation_id":"b4af3104-1a7f-4deb-9d2f-1669321c1666","resolution":{"observed_at":"2026-05-17T14:43:30.598089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Krakovna, J","venue":null,"work_id":"bd0c1c3b-9e82-4d76-b304-a66ed247bdc7","year":2020},"citing_paper":{"arxiv_id":"2604.28093","last_updated":"2026-04-30T16:37:37Z","snapshot_observed_at":"2026-08-03T09:03:06.300260Z","submitted_at":"2026-04-30T16:37:37Z","title":"What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-07T05:10:58.065201Z"},"links":{"citing_paper":"/paper/2604.28093"},"observation_digest":"sha256:973f989c8330c3f11eb7419f350902ffe56cf71a7b0f2fb1f7854a2cebab3324","observation_id":"f422a5c1-db34-40e8-8818-136a45f0867b","resolution":{"observed_at":"2026-05-27T10:49:02.974312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.18397","doi":"10.48550/arxiv.2511.18397","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Natural Emergent Misalignment from Reward Hacking in Production RL","venue":null,"work_id":"7ffab50f-285e-4804-b3fe-167071264d7d","year":2025},"citing_paper":{"arxiv_id":"2604.28093","last_updated":"2026-04-30T16:37:37Z","snapshot_observed_at":"2026-08-03T09:03:06.300260Z","submitted_at":"2026-04-30T16:37:37Z","title":"What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-07T05:10:58.065201Z"},"links":{"citing_paper":"/paper/2604.28093"},"observation_digest":"sha256:3fed53e93636f90a0b90c38fc07a14a70e2fa77f80519d86970c52cdd165aecf","observation_id":"3db5aac2-0534-4751-a061-16d7699ed47a","resolution":{"observed_at":"2026-05-12T10:36:30.971759Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":"2601.11868","doi":"10.48550/arxiv.2302.01973","metadata_source":"pith","pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-07-10T19:57:33.802494Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","venue":"cs.SE","work_id":"0624be05-1d97-4fd6-8300-b04b8a3ab04b","year":2026},"citing_paper":{"arxiv_id":"2604.28093","last_updated":"2026-04-30T16:37:37Z","snapshot_observed_at":"2026-08-03T09:03:06.300260Z","submitted_at":"2026-04-30T16:37:37Z","title":"What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-07T05:10:58.065201Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2604.28093"},"observation_digest":"sha256:a5a926d23be6eb2137b88830341ddfeaf3a51be547f13b75f66fbbb9302dfc83","observation_id":"1b7cf7a6-cd43-4d3a-949f-0897f251da6e","resolution":{"observed_at":"2026-05-12T10:36:30.975678Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Launching the OpenThoughts- Agent project","venue":null,"work_id":"0d794899-640a-4a47-9668-60e33daf4707","year":2025},"citing_paper":{"arxiv_id":"2604.28093","last_updated":"2026-04-30T16:37:37Z","snapshot_observed_at":"2026-08-03T09:03:06.300260Z","submitted_at":"2026-04-30T16:37:37Z","title":"What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-07T05:10:58.065201Z"},"links":{"citing_paper":"/paper/2604.28093"},"observation_digest":"sha256:b531b0b4b41b0cad66ceba29ddfe46943fddd0f596580d0b5017fec69b893227","observation_id":"8a086f59-ba23-44d2-b88a-926bbcb348a0","resolution":{"observed_at":"2026-05-27T10:49:02.987471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c5e3e052-1fd9-4ee2-ac8b-5020e2023e66","year":2023},"citing_paper":{"arxiv_id":"2604.28093","last_updated":"2026-04-30T16:37:37Z","snapshot_observed_at":"2026-08-03T09:03:06.300260Z","submitted_at":"2026-04-30T16:37:37Z","title":"What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T05:10:58.065201Z"},"links":{"citing_paper":"/paper/2604.28093"},"observation_digest":"sha256:59395040ddab494e3e956d6a4ad4fd76f27597e180021aad7fa4dee7d96deadd","observation_id":"7e9de2b1-74b7-4445-abf0-287fde749d88","resolution":{"observed_at":"2026-05-27T10:49:02.967565Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d46c252b-a348-4de6-871a-a288072ba679","year":2026},"citing_paper":{"arxiv_id":"2604.28093","last_updated":"2026-04-30T16:37:37Z","snapshot_observed_at":"2026-08-03T09:03:06.300260Z","submitted_at":"2026-04-30T16:37:37Z","title":"What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-07T05:10:58.065201Z"},"links":{"citing_paper":"/paper/2604.28093"},"observation_digest":"sha256:568b3dd37869f6fc06efb9876d09acb1676f3d37b7bb01b358add478f45a8330","observation_id":"eb01340d-9a2c-4242-9c66-0f175b648b52","resolution":{"observed_at":"2026-05-27T10:49:02.990589Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Von Arx, L","venue":null,"work_id":"a05caf0b-dfa9-47f6-b2ad-d4a3aa325d12","year":2025},"citing_paper":{"arxiv_id":"2604.28093","last_updated":"2026-04-30T16:37:37Z","snapshot_observed_at":"2026-08-03T09:03:06.300260Z","submitted_at":"2026-04-30T16:37:37Z","title":"What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T05:10:58.065201Z"},"links":{"citing_paper":"/paper/2604.28093"},"observation_digest":"sha256:54435565465ed3e19d14677d096e51d7a679a2fd46a251b007744aa55986970b","observation_id":"31434c35-f1cf-4fd8-a5dd-cc7b48aa5e9d","resolution":{"observed_at":"2026-05-27T10:49:02.980718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.24873","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T21:26:14.207661Z","title":"Let it flow: Agentic crafting on rock and roll, building the rome model within an open agentic learning ecosystem","venue":null,"work_id":"a1afde43-96e3-49c9-af14-25f128d65fe3","year":2025},"citing_paper":{"arxiv_id":"2604.28093","last_updated":"2026-04-30T16:37:37Z","snapshot_observed_at":"2026-08-03T09:03:06.300260Z","submitted_at":"2026-04-30T16:37:37Z","title":"What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T05:10:58.065201Z"},"links":{"citing_paper":"/paper/2604.28093"},"observation_digest":"sha256:5fcdfb1814004af718bf06b05c8fe0bfb5fd8b04042d78bb6e3697c3f0e64835","observation_id":"e9ceb1b8-34f6-46a6-8db0-6a882ed17d2a","resolution":{"observed_at":"2026-05-12T10:36:30.979968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fb9358e3-96fb-46ce-8280-e269f2881550","year":null},"citing_paper":{"arxiv_id":"2604.28093","last_updated":"2026-04-30T16:37:37Z","snapshot_observed_at":"2026-08-03T09:03:06.300260Z","submitted_at":"2026-04-30T16:37:37Z","title":"What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-07T05:10:58.065201Z"},"links":{"citing_paper":"/paper/2604.28093"},"observation_digest":"sha256:708b85b7855ba0d6af4f893060d44839423cf1ee9ce59505d78c9af8e0db5c1b","observation_id":"6e298221-0052-4e78-bc0d-20742c6049ab","resolution":{"observed_at":"2026-05-27T10:49:02.970934Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.28093","last_updated":"2026-04-30T16:37:37Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-03T09:03:06.300260Z","submitted_at":"2026-04-30T16:37:37Z","title":"What Makes a Good Terminal-Agent Benchmark Task: A Guideline for Adversarial, Difficult, and Legible Evaluation Design"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":6,"verified_fuzzy":4},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 1 inbound Pith citation observation for arXiv:2604.28093."}