{"as_of":"2026-08-07T19:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:13ece8ee9a632d21f0966223034adbcfc61f2d6a30de1c264a21366f98bed2f2","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T20:08:17.066898Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T05:13:41.056434Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T17:47:42.051078Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"cited_work":{"arxiv_id":"2603.22744","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.22744","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Beyond Binary Correctness: Scaling Evaluation of Long -Horizon Agents on Subjective Enterprise Tasks","venue":null,"work_id":"81e5216e-18f2-4ed6-85fb-779c0af1b0dc","year":2026},"citing_paper":{"arxiv_id":"2605.15230","last_updated":"2026-08-03T14:38:56Z","snapshot_observed_at":"2026-08-06T23:31:05.724157Z","submitted_at":"2026-05-13T18:03:51Z","title":"EnergyAgentBench: Benchmarking LLM Agents on Live Energy Infrastructure Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-19T17:43:11.038874Z"},"links":{"cited_paper":"/paper/2603.22744","citing_paper":"/paper/2605.15230"},"observation_digest":"sha256:c9056a2ea7fc52d252f8ba46452d34c23d3b7cb8ecc94c7d89603519ee0fdcb4","observation_id":"9d53c220-e0b0-4420-9daa-00ecbf236258","resolution":{"observed_at":"2026-06-01T02:02:30.857220Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.22744","snapshot_observed_at":"2026-08-04T05:13:41.056434Z","title":"Beyond Binary Correctness: Scaling Evaluation of Long -Horizon Agents on Subjective Enterprise Tasks,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.15230","last_updated":"2026-08-03T14:38:56Z","snapshot_observed_at":"2026-08-06T23:31:05.724157Z","submitted_at":"2026-05-13T18:03:51Z","title":"EnergyAgentBench: Benchmarking LLM Agents on Live Energy Infrastructure Data","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T05:13:41.056434Z"},"links":{"cited_paper":"/paper/2603.22744","citing_paper":"/paper/2605.15230"},"observation_digest":"sha256:59e8edc78fd0db0c6a321945700c0156ce43c306b049288aeaeb36206b920655","observation_id":"3e3dde50-6ac1-476b-867f-2ca27d05bee4","resolution":{"observed_at":"2026-08-04T05:13:41.056434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2603.22744/citation-record","integrity":"/paper/2603.22744/integrity","json":"/paper/2603.22744/citation-record.json","paper":"/paper/2603.22744"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:502deb141c26fb68d21b0ea35d38b0c881480e68a48ac15a0c0a2e15c3582926","observation_id":"d7fbd42c-d7d3-45c9-8d95-1b1252e38d56","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:71b6534db653a1cacec33907cfaa183711fab40f485f384b3d50707e0d229a4d","observation_id":"244ca19c-b5c2-4ca4-be3e-cca0d8e05ff7","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:9efa9271e564f8af46520deefa09fd93e8ac9a634197cb16fd542fe311bce762","observation_id":"36a45d68-d64d-43c8-9037-f44fe6a53ecf","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:acb5fc575f63e59107c82a333d28d3af6650aab4b3d71755fda511b45cd2ba97","observation_id":"0699bd2c-8021-4efb-8e8b-e014741fa273","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16941","last_updated":"2025-11-14T22:00:03Z","snapshot_observed_at":"2026-08-06T21:34:46.041153Z","submitted_at":"2025-09-21T06:28:17Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16941","snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"cited_paper":"/paper/2509.16941","citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:91c53a6f6e39ba40e9d66521ceb83c15d2d6228708af30de20f7f378b1ceaec9","observation_id":"1ca76b21-4b78-47cd-b3b0-9599ad8d659b","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":"Laradji, Manuel Del Verme, Tom Marty, Léo Boisvert, Megh Thakkar, Quentin Cappart, David Vazquez, Nicolas Chapados, and Alexandre Lacoste","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:0d87ef23b8478f0d21c0cff16061f33443128d470e423a87561a679f8feb8742","observation_id":"dc06e516-a635-4405-88f6-b1309e324584","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":"InInternational Conference on Machine Learning (ICML)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:fa1eec91ebfbfd52fc53e8588d6d73c4d48d0053a9a61dc3ab4f4a5bd78fac3a","observation_id":"d0e58077-934e-43e5-a8c3-24cef8486d2c","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:06da57366457569336b0cd284ca2f0b3879746b3891ced873bbebac485cc6e2c","observation_id":"56f252b3-a376-451d-9f64-a5ade0397673","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:07be6193bfc394dfff9a7566667eefa3a2fea9eead6829cda4d665016f880e56","observation_id":"d01f52ba-03d7-43a8-844a-5c42cbaa0855","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:dd8952d63c53e92948eaa809aab3c9fe26f7bd99ba9bbc55624fed4fe3b0cd22","observation_id":"029ad0de-9241-4498-b7e1-d7836ed857a5","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:4a28c5dfa4bdfb175ecb961e3fa25e066a32bf9786aba3f0374f4b7f58ac0535","observation_id":"5b4cd6d3-dfc4-4a6e-9ff5-87e141f12f5d","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":"Richard Landis and Gary G","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:16caa5882c28e02a28a3054abb9aa21b60a2969295c2fc1fc6e2f74d25ab06e4","observation_id":"e3e38240-89fd-4922-a887-a005e3704b23","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:3c0656977ede127f3db8df8a223ed46fce663ddbf247a707e3b51643f7578707","observation_id":"b35ccd49-185e-4bc8-a492-0a209e7a8130","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12670","last_updated":"2026-03-13T07:33:01Z","snapshot_observed_at":"2026-07-06T22:45:44.135338Z","submitted_at":"2026-02-13T07:06:06Z","title":"SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12670","snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"cited_paper":"/paper/2602.12670","citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:bb5f05fa772789241bf57758224d3a5d13bd68ac902fb381b858da3a90b6e8b9","observation_id":"400d0255-1a79-470d-aa5f-c8a680cdb8c2","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:4270f76d515a14533d546a91e39b1f5bb1712ac5b301da3f8458b4b26aced4d3","observation_id":"8037ce73-bc4b-4e36-bf6a-42b001d72878","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":"Fung, Chun Yuan, and Li Shen","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:5dcb9a410781b7298dfebfe8be148f34d918cae46c05020da8fee209f7d604fa","observation_id":"f6023b7d-4b66-403b-a774-1927ab8612f4","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:58a3730a6fe5c235f6b2ee5889b02c1100bbbe5ef63291038c1bcd70c83ae7e1","observation_id":"61888c53-ed6d-4790-a372-2d85eaea0dd1","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:711d93920b34997656b4222f42a288a06d5945f3847acc73f75575fef7ed66fc","observation_id":"8d368530-a062-478b-85e8-c2417287c8c1","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":"Hendryx, Brad Kenstler, and Bing Liu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:8e52d3ffc9f9e265233ab2959db517d63fc348375b5605cb74a7e10072c13566","observation_id":"a4458278-742e-4962-9600-156361e1d2ef","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:577b7365eae567e92dbd93a1a85fa41d1089b196802e2943b8c63a57ba4fbc97","observation_id":"344f05a3-a7a4-4c44-8491-3b539f241cbb","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-07T16:25:50.798894Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:996a5a4ab401fa8fd8847515d7f5f4cb68baf7f83cc7b359bccba52af4f991d0","observation_id":"3b7189d9-5807-4d9e-aa2f-658142edfee5","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:d7a38925ac219ddbc1940a8b14aa83b09aedf039bf83d79402192754385fed91","observation_id":"ed7b3964-4703-4a33-bb40-09cca2a2615a","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17399","last_updated":"2025-05-26T11:15:36Z","snapshot_observed_at":"2026-08-07T14:45:38.156584Z","submitted_at":"2025-05-23T02:16:11Z","title":"FullFront: Benchmarking MLLMs Across the Full Front-End Engineering Workflow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17399","snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"cited_paper":"/paper/2505.17399","citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:fb4a82d0d090890d0a934d3eb61b7cb13adc6e9d6ab1603e67818dd179479c7c","observation_id":"f44f3ef9-fadc-4a67-a9a8-b92739647cc3","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12624","last_updated":"2025-08-18T00:07:23Z","snapshot_observed_at":"2026-08-01T14:58:17.402553Z","submitted_at":"2024-06-18T13:49:54Z","title":"Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12624","snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"cited_paper":"/paper/2406.12624","citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:ee732db3f6309b1ce72c0406ae9849caa8db4532e598587f6d80455943c77ad8","observation_id":"155f65ea-abb3-4eec-bf17-4bce3d1a5f27","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:3161aea0f129c4b8c1497eb66b4ca8337773d33b987aa7d05669071559832d6b","observation_id":"90cda441-fc70-486a-ae9e-1cfe9692fb85","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:5b2766fbd838a4364ff1a1e608d4e40399e22180fddd33181bc168c32984832f","observation_id":"08659bd8-a593-4980-8ef5-9d70334e8a5b","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.04203","last_updated":"2026-06-10T05:46:09Z","snapshot_observed_at":"2026-08-05T11:50:29.709721Z","submitted_at":"2025-12-05T23:28:09Z","title":"FronTalk: Benchmarking Front-End Development as Conversational Code Generation with Multi-Modal Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.04203","snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"cited_paper":"/paper/2601.04203","citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:69e862dd9098ddf1803aee5102a637309b968c90401f2680c2179fb113f4dd6e","observation_id":"042d3528-4b50-4f38-aa71-cf3d5f648a77","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:d8e32aa51e803b591b3e2ecde44db9dc045bdb8ccb4d443de166f3a81718dccb","observation_id":"611bd42f-a641-4568-baf4-bbd09117795f","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:774f7a965d98808df67d8f0118d1676fb9167eb3d45e8c4172519e04cc0dddd9","observation_id":"7c22019b-63a9-4eeb-a07c-a2d650fa6d9c","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-02T22:19:29.043854Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:feadf40a66c11478bc6480c3eaa031f5e2c36763bbe3669b648b8a20035b5793","observation_id":"59403e54-e626-4585-b7ff-e04ada0d2e2e","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:dfdfb132e8ba5fcfbef2a331042dc0e8fb3a86ba9507c533b79a0c1d49964c0b","observation_id":"bdfdcc78-df99-4818-ad2a-1b149c2c6aaa","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":"Xu, Hao Zhu, Xuhui Zhou, Robert Lo, Abishek Sridhar, Xianyi Cheng, Tianyue Ou, Yonatan Bisk, Daniel Fried, Uri Alon, and Graham Neubig","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:5f573401d2236321da3ffcae6903d094ca75ec11a2156ebe2a8e15bfba346da5","observation_id":"f937b0d4-aada-488f-9716-a1885ed80966","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13832","last_updated":"2025-06-18T13:10:14Z","snapshot_observed_at":"2026-08-07T04:40:03.152095Z","submitted_at":"2025-06-16T03:20:31Z","title":"FrontendBench: A Benchmark for Evaluating LLMs on Front-End Development via Automatic Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13832","snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":"highlight-to-cite","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"cited_paper":"/paper/2506.13832","citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:541687d57f875043a09848e6cffcc884e905e2f951c390048077fde2e2895bbf","observation_id":"71363743-5b87-42af-bc7c-e07ff116eb50","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":"Score Description 1 Content is largely irrelevant or incoherent; fails to address the chapter instruction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:184b69d4e68dfe4a523eb39de3030bedec77358ccba31e9df6dc91f299a19b1e","observation_id":"be060a8a-8ea2-4446-81de-c3a877926280","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":"Score Description 1 Visuals are broken, missing, or unreadable; severe rendering artifacts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:c906e4df1adebf443fedd8939000af53c162a26c974664612bbeeded69ad30a5","observation_id":"17c79079-b228-452b-ac59-6d3645994748","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":"Score Description 1 No discernible teaching structure; concepts presented without context or progression","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:172da3bd3099a2a471f400638e6303f1b64fb14b6dabf227fdb7e6bde1d509b1","observation_id":"3e1b5513-247d-42dd-ad0a-71b48796cefb","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":"Score Description 1 Severe desynchronization; narration and visuals are unrelated or offset by multiple seconds","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:fbdef4e651092f69e52d4ee3023dde9f4a58b438821bccb45b275c8e0f0b707b","observation_id":"b449af07-562b-4866-bf43-0da62021b8f8","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":"GRPO vs. PPO gradient flow","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:a5a7f53c6779ff860b0d4e4eafbcecab172955c9d7bafd142fb6b28d460c22b9","observation_id":"2985bd7a-d448-4969-a971-f859e958f03e","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:e21911478ce7ef2af0ba774785db9ecf8b713cd83bf9b487c789397d976e145a","observation_id":"e9118d6b-a471-48a6-bd43-c89eabda3870","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:0c92bfe94bac0d207c04018415e28febc75496ff2eecc24ae12961ccca73418c","observation_id":"c7986176-e56c-400d-b8db-0ea885c2e752","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":"Do NOT interpolate","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:99a50cb155fe588b00aac0a546fe031d302a5abae4a2b9f4a2328b267cb2b785","observation_id":"315e9659-0994-45b3-80ef-59c08094b135","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:08:17.066898Z","title":"rubric_scores","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T20:08:17.066898Z"},"links":{"citing_paper":"/paper/2603.22744"},"observation_digest":"sha256:534015ba35efd4364ba4829037a771a172348ad03960700781133f9393e79495","observation_id":"bde56565-cc51-4488-9f89-b8cfcc61b9dc","resolution":{"observed_at":"2026-07-13T20:08:17.066898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.22744","last_updated":"2026-05-29T00:35:02Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-03T18:04:48.244219Z","submitted_at":"2026-03-24T03:16:32Z","title":"LH-Bench: Skill-Grounded Evaluation of Long-Horizon Agents on Subjective Enterprise Tasks"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 2 inbound Pith citation observations for arXiv:2603.22744."}