{"as_of":"2026-08-07T10:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c22276433829a8b55be1b33c2e4ae3101ac6c98e70fc3daaa0f84192ea3a01b2","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T18:01:55.716141Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.19704/citation-record","integrity":"/paper/2606.19704/integrity","json":"/paper/2606.19704/citation-record.json","paper":"/paper/2606.19704"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.03828","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:29:30.298344Z","title":"Assetopsbench: Benchmarking ai agents for task automation in industrial asset operations and maintenance","venue":null,"work_id":"fdef28c8-7933-48e9-8bb6-bfb61ad49ee3","year":2025},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:dee4f22d6f3479ba4d3dd970f9e7fd63289c38074c3ce2ef8a289c8f542c38df","observation_id":"ff0fd833-e034-4644-8f5e-8e0f421de361","resolution":{"observed_at":"2026-07-04T03:29:30.300789Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:4d3d64a26fe3547df24ed74d7a04935b7d116c282579f4db00973887e051a45a","observation_id":"3c4eda0b-ae80-4a80-bf17-e6c75b03229d","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14704","last_updated":"2025-08-20T13:28:58Z","snapshot_observed_at":"2026-08-05T18:20:51.232791Z","submitted_at":"2025-08-20T13:28:58Z","title":"MCP-Universe: Benchmarking Large Language Models with Real-World Model Context Protocol Servers","version":1},"cited_work":{"arxiv_id":"2508.14704","doi":"10.48550/arxiv.2508.14704","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.14704","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Luo et al","venue":"ArXiv.org","work_id":"b8148e6c-83f1-4051-b36f-12da866268e3","year":2025},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"cited_paper":"/paper/2508.14704","citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:6f6bcdfe07b7470605acf918ec26d6db032ef480dac82cdde254f7b23d4ca0a4","observation_id":"22815be2-c235-482a-8200-94c1d5d31fbe","resolution":{"observed_at":"2026-07-04T03:29:30.310286Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.17158","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:00:09.525203Z","title":"2509.17158 , archivePrefix=","venue":null,"work_id":"0d42384d-fce1-419b-ad67-717ec91929b3","year":2026},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:89b65ea3a8de3b862c5d617daeef6efd62ff04e233dfd29fd814bad2e8bade04","observation_id":"7ba79df8-d1b7-4ca3-b2ca-fd05a87bdd1c","resolution":{"observed_at":"2026-07-04T03:29:30.295775Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:606f3a0e2b277f2251c75980b4c708aed4fbdf58e7f77a0f8b94c545c6a8f1d2","observation_id":"01bd111a-95b1-4b04-9342-e53a24e019e2","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22953","last_updated":"2026-05-11T10:27:38Z","snapshot_observed_at":"2026-08-03T12:05:35.781830Z","submitted_at":"2026-02-26T12:48:02Z","title":"General Agent Evaluation","version":2},"cited_work":{"arxiv_id":"2602.22953","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.22953","snapshot_observed_at":"2026-07-04T03:29:30.288823Z","title":"General agent evaluation","venue":"cs.AI","work_id":"3a40369d-f7d8-4112-9617-f5161de436e6","year":2026},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"cited_paper":"/paper/2602.22953","citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:9e0e6ce9f2c66ae7c94f4c171d213b65a5bed15ed8ca32751865818e13c013ac","observation_id":"ab7e4b51-be0e-434d-b848-d4eecba4f45a","resolution":{"observed_at":"2026-07-04T03:29:30.290814Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.08171","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:29:30.336331Z","title":"arXiv preprint arXiv:2603.08171 , year=","venue":null,"work_id":"b6a7b754-ce73-4d82-b8b4-4b8b57e6d295","year":null},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:94d949ef7eb315d925c96caddb3dfca027cab4e925acecbaead69a41a7760ef7","observation_id":"47094d9c-34d2-4008-90f0-43fa7578114a","resolution":{"observed_at":"2026-07-04T03:29:30.338616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:85a949731fe4625ac480b725c9bde1e7435ad5fde29edf6a7cdf79560ef29266","observation_id":"fc703a00-ea42-42f0-bd74-c7bd8777267c","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-02T22:19:29.043854Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":"2406.12045","doi":"10.48550/arxiv.2406.12045","metadata_source":"pith","pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","venue":"cs.AI","work_id":"6a8d8dc4-0cc0-4052-8109-abbcdcd4a962","year":2024},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:562875edb899f0f15803a3585f8a2d1d0fae64b39304756c7d38678fd2fa3e5b","observation_id":"60a67d77-5cd2-4ca7-acfa-006c5c98a92f","resolution":{"observed_at":"2026-07-04T03:29:30.282236Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:21.86453+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:21.86453+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:027ebd2bea1bd07027a22d2f6c6106f66f72a5d6c6d35a8fc3230902c9e43be0","observation_id":"440ff841-087f-4b2a-a024-ded051d40fde","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":"2026 , note =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:ece50bef0b5711e670f039cc2bce19e81c81e65232666644e97c7fccd83b937b","observation_id":"d7d0ca40-f91a-422a-88f6-9443fe359276","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":"2026 , note =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:e99bd2672b47436381beae071ee75a8f63f6262a5f047e02b0aa20961b33ede8","observation_id":"85ccfbc5-4ee4-4b33-8164-290bec07d9ee","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":"2026 , note =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:3c4497f2601482e0aed9238fb177a9b0d74b636d05248ba6455e3a4d7893a1e9","observation_id":"6b2363c7-cb04-4d68-bcf8-1fbe6b4d7268","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":"Skills and Knowledge Plugin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:0a2ebe56578e424220c7e6eb55c7f73f48e9b68f2bcbda1116f9b347bca8d4b1","observation_id":"a47047fe-12aa-462d-9a36-744243c73dc7","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":"Skill-Knowledge-Augmented Agents on","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:28c6ae2394b5252068668cab42665ff965c4172a0911ae9c208e8a30a583a9cd","observation_id":"8e1eb952-a265-4f20-ab76-309abf561c7a","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20630","last_updated":"2026-05-20T02:30:07Z","snapshot_observed_at":"2026-08-02T01:45:46.622326Z","submitted_at":"2026-05-20T02:30:07Z","title":"Evaluating Temporal Semantic Caching and Workflow Optimization in Agentic Plan-Execute Pipelines","version":1},"cited_work":{"arxiv_id":"2605.20630","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.20630","snapshot_observed_at":"2026-07-04T03:29:30.284261Z","title":"Evaluating Temporal Semantic Caching and Workflow Optimization in Agentic Plan-Execute Pipelines","venue":"cs.AI","work_id":"da907a78-7a4d-4386-b563-8102848adc11","year":2026},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"cited_paper":"/paper/2605.20630","citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:c3cd8c53f091f07b0e2d6b33208a4f09e312ad8f82763d99e96b8334e7b318b7","observation_id":"005900d7-7efe-43ac-bdde-b5df9c999fa5","resolution":{"observed_at":"2026-07-04T03:29:30.286771Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":"2026 , note =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:c16de161d04b976f84fbc2f4becb202ff7e1edc7ce6993a99be0328783f1cdda","observation_id":"d423bbb8-69e1-4dfe-ae6f-39d39a3f53c1","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":"Extending","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:bed78255ebfec1f728393fa91b3a31ad286e28db25ac590a9830554baf5cc527","observation_id":"e76ab5c3-f8f6-4621-82ff-5aa426845c4e","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.01532","last_updated":"2026-05-08T22:05:26Z","snapshot_observed_at":"2026-08-03T04:25:49.405977Z","submitted_at":"2026-04-02T02:09:27Z","title":"PHMForge: Evaluating LLM Agents on Industrial Prognostics through MCP-Native, Algorithm-Grounded Tools","version":2},"cited_work":{"arxiv_id":"2604.01532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.01532","snapshot_observed_at":"2026-07-04T03:29:30.330468Z","title":"PHMForge: Evaluating LLM Agents on Industrial Prognostics through MCP-Native, Algorithm-Grounded Tools","venue":"cs.AI","work_id":"52b2d7b6-6f99-4de0-88b5-70c6c07c72a5","year":2026},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"cited_paper":"/paper/2604.01532","citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:26777187c950ff2c98f1525baac3444dc11099f78fd9b618708b6b6e3293a8c4","observation_id":"380b02eb-e37c-4ddd-a938-d11eedb96039","resolution":{"observed_at":"2026-07-04T03:29:30.332866Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:411e84ded033c0e70b0c980412ed9334decaf583b560a1f649ee49527dcd8c1a","observation_id":"92f60392-ad13-43cf-8481-f0315401c918","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":", institution=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:b646fc280d7a991aabff6f4aec5174ef53fa57e3992978c434af0a0c5aa4c059","observation_id":"a0d7392e-9469-4ec6-a18b-4e693a86ad3c","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":"Profiling and Optimizing the","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:18b5e439257f99c3c9f7985ba7425d93f1779e58107aa8e32e8675a7625102cf","observation_id":"ab315bef-0c50-4bd3-b952-6c3adc9c4c75","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":"Performance Optimization of the","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:acd2957f0c7c865bb85e217fd547afdb0c8c8733bf5d0ad923f23de06be5e94c","observation_id":"0ee71c25-740f-4531-a9f0-5ffceded1700","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":"Multi-Modal Agent Inference Optimization for Industrial Asset Operations: Extending","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:ad13ff4f5b4e732d2556df820373ee844581160fb7b1dff1c63c9a61792a00b9","observation_id":"ed70051b-5385-4349-8506-10e18117d46a","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":"2211.09110","doi":"10.1007/bf01194075","metadata_source":"pith","pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Holistic Evaluation of Language Models","venue":"cs.CL","work_id":"cc02a01e-7218-47dc-8e66-3333e7e4adec","year":2022},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:506d8814fe843ec1dde2031e8fd067e8984e12bd7f8fd2eedfb85de73601818e","observation_id":"9234c39c-5615-44da-bf09-5cf7d4ca80fb","resolution":{"observed_at":"2026-07-04T03:29:30.320599Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":"Proceedings of the 2021 conference of the North American chapter of the Association for Computational Linguistics: human language technologies , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:6401eae7f8efc23a16bbf1d0d3ee6a86bb12e2d3eb3a7e0ce67297be9a92e0e8","observation_id":"95f51d96-0c70-4ea5-b302-e9f97d5ac34d","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":"Proceedings of the 58th annual meeting of the association for computational linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:ec147c8007a7acd40a308f8ff9b1afaad240d4140b4ef675e61989b70bb36c8c","observation_id":"ca166462-f6a9-4716-b23c-53deb31b4e73","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":"Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:4103f383857fd0a42d77ce83f025b01fd2ac5438c644d31db63edd867c278d76","observation_id":"ae3f3cad-9b7e-41ae-8ac0-260cbc075fcc","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.15366","last_updated":"2021-11-26T19:39:34Z","snapshot_observed_at":"2026-08-07T00:21:07.584753Z","submitted_at":"2021-11-26T19:39:34Z","title":"AI and the Everything in the Whole Wide World Benchmark","version":1},"cited_work":{"arxiv_id":"2111.15366","doi":"10.48550/arxiv.2111.15366","metadata_source":"arxiv_reference","pith_arxiv_id":"2111.15366","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ai and the everything in the whole wide world benchmark.arXiv preprint arXiv:2111.15366","venue":"arXiv (Cornell University)","work_id":"5084c532-93b1-48f4-84ae-db5ec19ee696","year":2022},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"cited_paper":"/paper/2111.15366","citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:5d88566aed4ad4b70528e8721d233df5d752aef1816c6c9d86623d4c2ec0fe54","observation_id":"1aecd48d-c9ed-4246-a7b2-43ca3d38ce7a","resolution":{"observed_at":"2026-07-04T03:29:30.305905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":"Proceedings of the 2020 Conference on Empirical Methods in Natural Language Processing (EMNLP) , pages=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:00b6752a719e0bc4a35ed1bfe78af0f419637d097d569899de5adae8c298f10f","observation_id":"168ddf07-d86c-4d5f-be00-b86a77fff2fa","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T18:01:55.716141Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:2b2c15eb8b8f4ea4fa2c79737b88fcb5662f6292d8bb719ad1ca1601ef6f97b2","observation_id":"c4d6f2a9-947a-43dc-b530-d397240f62d3","resolution":{"observed_at":"2026-06-26T18:01:55.716141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.07002","last_updated":"2021-07-14T21:08:30Z","snapshot_observed_at":"2026-07-06T11:29:14.236629Z","submitted_at":"2021-07-14T21:08:30Z","title":"The Benchmark Lottery","version":1},"cited_work":{"arxiv_id":"2107.07002","doi":"10.48550/arxiv.2107.07002","metadata_source":"arxiv_reference","pith_arxiv_id":"2107.07002","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chunyuan Deng, Yilun Zhao, Xiangru Tang, Mark Gerstein, and Arman Cohan","venue":"arXiv (Cornell University)","work_id":"2662531a-bd8c-4a98-9104-354aba180472","year":2021},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"cited_paper":"/paper/2107.07002","citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:9ac2df2cd3dfec2b6233f59e5e9b8e7c85359d41956fdd5e7b63c277f0b6552a","observation_id":"162ba649-9612-4323-a7ca-b8e49fb35ba0","resolution":{"observed_at":"2026-07-04T03:29:30.325999Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17829","last_updated":"2026-05-18T04:03:18Z","snapshot_observed_at":"2026-08-05T06:31:55.615676Z","submitted_at":"2026-05-18T04:03:18Z","title":"Interactive Evaluation Requires a Design Science","version":1},"cited_work":{"arxiv_id":"2605.17829","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.17829","snapshot_observed_at":"2026-07-04T03:29:30.270598Z","title":"Interactive Evaluation Requires a Design Science","venue":"cs.AI","work_id":"a6e07ff9-bc43-4ddc-9abe-bfe70d958aff","year":2026},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"cited_paper":"/paper/2605.17829","citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:45e198cbc8e240188b17361574617d75965d60936c5e6f35bbf3f9aefc60ca6c","observation_id":"c67cb534-4b52-42ca-9309-07186f6b271c","resolution":{"observed_at":"2026-07-04T03:29:30.272826Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08518","last_updated":"2026-05-08T22:00:58Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T22:00:58Z","title":"Results and Retrospective Analysis of the CODS 2025 AssetOpsBench Challenge","version":1},"cited_work":{"arxiv_id":"2605.08518","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.08518","snapshot_observed_at":"2026-07-04T03:29:30.340133Z","title":"Results and Retrospective Analysis of the CODS 2025 AssetOpsBench Challenge","venue":"cs.AI","work_id":"2dcb05c7-d168-4460-818c-9907ea2b4d54","year":2026},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"cited_paper":"/paper/2605.08518","citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:6c393d8615f51b76927dec389fce6b66e78857e1814eb64cf94a1a9a00937d66","observation_id":"fdffce0d-9d50-429e-8e1c-0a6dd516e1ac","resolution":{"observed_at":"2026-07-04T03:29:30.342214Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.14167","last_updated":"2026-05-13T22:41:29Z","snapshot_observed_at":"2026-07-31T07:45:22.941891Z","submitted_at":"2026-05-13T22:41:29Z","title":"The Evaluation Trap: Benchmark Design as Theoretical Commitment","version":1},"cited_work":{"arxiv_id":"2605.14167","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.14167","snapshot_observed_at":"2026-07-04T03:29:30.312002Z","title":"The Evaluation Trap: Benchmark Design as Theoretical Commitment","venue":"cs.AI","work_id":"8cea7a78-db85-44fd-be55-22514833b5e5","year":2026},"citing_paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-26T18:01:55.716141Z"},"links":{"cited_paper":"/paper/2605.14167","citing_paper":"/paper/2606.19704"},"observation_digest":"sha256:ba0973304a170e5c549c71faaab4dd6303229a82154005cc977be44e1255a606","observation_id":"749b2ad1-4c0d-4f07-b09a-7d6e23613dc9","resolution":{"observed_at":"2026-07-04T03:29:30.314635Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.19704","last_updated":"2026-06-18T02:02:46Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T16:15:58.108875Z","submitted_at":"2026-06-18T02:02:46Z","title":"Beyond Static Leaderboards: Predictive Validity for the Evaluation of LLM Agents"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":11,"parse_uncertain":0,"unresolved":21,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2606.19704."}