{"as_of":"2026-08-09T13:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c1b6e87fc6f3ba9afffd90cdf6b7b24573ca87ad168230b7135728f7ecef58ca","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T09:44:28.026904Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.03657/citation-record","integrity":"/paper/2606.03657/integrity","json":"/paper/2606.03657/citation-record.json","paper":"/paper/2606.03657"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"CodeUpdateArena: Benchmarking Knowledge Editing on","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:31bee2a2e7b9f0234cf9e63fa621e6e4e69161e12da39d2a9463c18bd4d76bb4","observation_id":"e7955a95-c823-4fb1-bfe4-d951f49a7fca","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:799e6a3dd104b11316b61228447ff1179fb243a95d6f9b20064b3683838dcb90","observation_id":"adacd601-b33c-475d-a44a-80c66bda4e1a","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.naacl-long.348","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"L ib E volution E val: A Benchmark and Study for Version-Specific Code Generation","venue":null,"work_id":"15aefa52-4b62-4195-b351-01b2b26138f3","year":2025},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:0dc256a8cb4c50a76bbf9803fbfffe4d787dc36dc7ad03c4008d24c5830437a4","observation_id":"6eb24062-fb32-4951-8d11-da6ea2dcc34a","resolution":{"observed_at":"2026-06-28T09:51:51.016579Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:b508e05fdec5a493b6efeb16d043592486bafc6e40fb3fad9aaa7e49f2004ebd","observation_id":"e524a271-da3d-4997-b557-92fdd0ee02fd","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16922","last_updated":"2025-03-21T07:33:59Z","snapshot_observed_at":"2026-08-07T16:47:17.113884Z","submitted_at":"2025-03-21T07:33:59Z","title":"RustEvo^2: An Evolving Benchmark for API Evolution in LLM-based Rust Code Generation","version":1},"cited_work":{"arxiv_id":"2503.16922","doi":"10.48550/arxiv.2503.16922","metadata_source":"arxiv_reference","pith_arxiv_id":"2503.16922","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Liang, J","venue":"ArXiv.org","work_id":"df2cba79-8f28-4832-bdc6-cfccd9adc5cf","year":2025},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"cited_paper":"/paper/2503.16922","citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:9fd60f2eb1f0c3445437f1270f1e2e699fba4b4fb84586c832656aed6a680180","observation_id":"0397b38e-bc41-47c7-b00a-59d33262fe4b","resolution":{"observed_at":"2026-07-02T03:46:32.453747Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"The Thirty-eight Conference on Neural Information Processing Systems Datasets and Benchmarks Track , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:92b7115efa786604968dff0782176d96e05c7a493a19283e15e7a7615cb56461","observation_id":"9c247155-2802-4b1d-834f-4a3357917ad1","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:32f9d55a33fb410912501179f63ea0a3d3738fc95dab8db40fe33922fc737a3d","observation_id":"deecd15e-1726-4ef9-8f69-a067f2dbb2cb","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:4e32d2b133259099d0ec25a4c0548d99147f6bcb64c182268f97005e76eab253","observation_id":"85a44002-9ffc-47a5-8e5f-b436a2d8ff94","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:e00a6236be58300e1a7949f567b66d7e5d7397b1111ce23de170c01164e5c570","observation_id":"d62c6b7d-f855-4382-869a-1e4599daf2d2","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:55a00921efc04304e1196aae9a47bb67596502651890c50867786d95042b93a1","observation_id":"48ba2073-e115-4440-bc83-56da00c56b7a","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:7d43caa8a187f7ce6efad1b0200f6ef47b06609ac3070560666617cd19594c15","observation_id":"b5a910da-6b13-4a6a-95dc-9f411509ad67","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:ebc1401ef2795bccf9500e978c8fa3223963f20462fb4f2ae33bd6d0c5b722e6","observation_id":"5dae01cb-e0f7-4187-a93a-641857bb9af2","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:5404dcb34fa7b4eebb8947796f0144fb3480ec5273417be0406b65ac9f0b852a","observation_id":"679a0598-d0da-4856-a9f1-e19046dea0e8","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"Aging with","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:d9df91f8b65e68516917dde4e308679dd137c22700074984007842c8126f16e8","observation_id":"be0491e9-eb51-497f-a202-a44a524dadb4","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"The Eleventh International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:c58c4d28789b5228f5809a0a5d7919665fbd333143bc9ded7cbf27e4e620fb4c","observation_id":"834ae697-739c-4c28-9b1b-b7458fbcfc5e","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"Locating and Editing Factual Associations in","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:05e7dbc52c7f0802d6fd660ef88b33ad74ecce9e550e82d68b18942f3fb5924a","observation_id":"9407a7b4-362e-40ad-b9ba-25990e1b538a","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"A Comparative Analysis of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:981d913889e1c192a33fb6d29edb7f39bef6bdf962f682e4f019f8231da56666","observation_id":"0e0b11e7-c42d-41e9-9990-015476618eb8","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"Efficient Knowledge Injection in","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:aa697e01f892719cafadb5135563a1d41f6835030fb2369644968b94ed37eec3","observation_id":"d4cfce44-da79-458e-8e4e-81914a93e10a","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"Forty-second International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:d83ae097c4d75990fd785dd48a064d7c60aea1fe3d70bf2a781d807d82377fd5","observation_id":"eb496769-3f74-4e92-a04c-db77ad56db46","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0941.291025","doi":"10.1145/290941.291025","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The use of mmr, diversity-based reranking for reordering documents and producing summaries","venue":null,"work_id":"d2ff490e-05d9-4845-a137-6a08e42c55cc","year":1998},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:6bdc48fd10a0f8d7a9a9ac2824c6bdaeed23b97121af834cc7c0390ae1d42265","observation_id":"15d8f8bf-e1b7-4b90-a77f-9741b6404267","resolution":{"observed_at":"2026-06-28T09:51:51.014753Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:57e6b177161bbf8f797ad5bff169986d4aabe18d684e6100456b633e4f60f4f4","observation_id":"e3687fcc-0e94-4d8d-90c1-74e385c44d82","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:1526bc9f18c2ff32d4d92a1457da832806435dbd7e27cde88e141e76d261fb8c","observation_id":"603b3fd2-7d38-482d-ae42-17f1bd85487b","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:0135df4407b72d9f60800383688b91b52a6f43a4920766bec89cb4f0c4b282b2","observation_id":"e5a5021e-ff86-427b-b062-ca13d5b20d70","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:7476afd90c56380dc8ef47c31efdb1461c8439388dafa1fb0acc312a47a2ce71","observation_id":"66573219-cdce-4260-8c2a-2b40899885e2","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:5d23837bbbc7aee5f869e9d299752d86cf19c070be724c81dabc135b8a00a5e2","observation_id":"afa0da87-0afa-4b5f-8298-12041cc8226e","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:1e9a899fa3bfdb4bc1b286efa3aa5ba86bcc08d5022437d374f58931a23f0d61","observation_id":"b2b861d1-83af-4880-93f8-2d170ddd1396","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:b738795818f9a6fe069f34803800fcc8ca41e18eee4d8402bcb58f6ebc7b6b4a","observation_id":"c77a100a-7ea1-4c27-b8c1-20df6ace32b3","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:b532557672018f6effa02fa61348e0db98c3f452b19c5db5ed0607663cb5bf7a","observation_id":"ebe705ff-d361-4707-a9dc-af5a6d143cf5","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:d5de5e5a46941a3adda6e68a7b87e1830dfa32d30afa42cefe4e14b7a28c3656","observation_id":"001b22eb-3c91-42a9-bca6-da4ae5b7d99c","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:ae14b30f687d31ebc9221e058bffd96f0fd96002a984f1ba93d8e86c8c747766","observation_id":"7f6df33c-c9d2-4462-bc5f-97ff5dc5e4ae","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:79fc3229d61be97378b0bef73c5d6620f2bd47adc0da8a4c5929372898487a88","observation_id":"7a5d7772-203f-4178-8385-a9194dc6767e","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:1dd026d5d7e1334ce96fc90fb3af1005e5fb25eeecae7fbe4b50b002a1a37814","observation_id":"3e73944d-d38e-47d0-a6fe-2f1da66e52ae","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:5e7613676b795f2e37dc9146c1b9a898e0da182232229165a99c592c836c78de","observation_id":"58264692-7bef-48d9-afa0-34d73eaf6dc2","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:9fb69e17038a748c738478954b5f0a3575d500037a01116f9d83d572924fc663","observation_id":"751eff6c-46f7-45e4-b321-76b2dee6791b","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2022 , eprint=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:90a33ea3ca8723558d275eae22f935eb673a785fbb2e50c68e92acecca420d4d","observation_id":"409213ee-78e0-4463-bedd-2aa6bbae907e","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:5546b24f85f215b29e416a1aaf5830e4c5ad8528865beb02ee4464fc095f86fe","observation_id":"ce9df547-834d-4e57-898b-b979c876143f","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:91df8f2670a70b347988b0f5095907e4b55ee7cffc53c2507cef66df91c15b85","observation_id":"926d1054-99ed-4be9-a396-3721bf48e717","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-025-09422-z","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.562716Z","title":"doi: 10.1038/s41586-025-09422-z","venue":"Nature","work_id":"9835b482-5032-4135-93dd-82a066677569","year":2025},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:c024858bf9aaba5dbb6d4ea5072cf8735190f2eee097ecd5708466618d94390c","observation_id":"7e745ba0-8bd5-412c-a085-88e9bab000d3","resolution":{"observed_at":"2026-06-28T09:51:51.012252Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-03T22:08:21.094896+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T22:08:21.094896+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:ccb8daddbc170a3faff8ee09e819d0f6375ef6b86f31ddbe7f6748f6755df5a0","observation_id":"61f48963-e39c-46f4-a0fd-9ee8f35b7b34","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T09:44:28.026904Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-28T09:44:28.026904Z"},"links":{"citing_paper":"/paper/2606.03657"},"observation_digest":"sha256:22aa387e6dca747f95dbd2d5f7e1cc8f0740adcb5638bf63cd38921755c64dc9","observation_id":"3a566521-491e-422b-8e2f-6260c1ee5db2","resolution":{"observed_at":"2026-06-28T09:44:28.026904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.03657","last_updated":"2026-06-02T13:46:04Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T20:01:28.445038Z","submitted_at":"2026-06-02T13:46:04Z","title":"Diagnosing Knowledge Gaps in LLM Tool Use: An Agentic Benchmark for Novel API Acquisition"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2606.03657."}