{"as_of":"2026-08-24T04:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b92b59fcd4712050523d130c43e10c40eab292a73a1b3131dc3686a2f017810f","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:32:54.413371Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08700/citation-record","integrity":"/paper/2608.08700/integrity","json":"/paper/2608.08700/citation-record.json","paper":"/paper/2608.08700"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:54.305784Z","title":"Li, M.; Zhao, Y.; Yu, B.; Song, F.; Li, H.; Yu, H.; Li, Z.; Huang, F.; and Li, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08700","last_updated":"2026-08-09T13:25:54Z","snapshot_observed_at":"2026-08-20T07:24:22.827004Z","submitted_at":"2026-08-09T13:25:54Z","title":"PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:54.305784Z"},"links":{"citing_paper":"/paper/2608.08700"},"observation_digest":"sha256:c7fbc88d824c48cf7aeb006e294fcc4e5317dad23035d8988c1c4c4c5c62297c","observation_id":"8aaef3f8-eff4-4a5b-9073-a6c8f633a1ab","resolution":{"observed_at":"2026-08-14T04:32:54.305784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27820","last_updated":"2026-05-27T01:28:15Z","snapshot_observed_at":"2026-08-17T03:49:04.415338Z","submitted_at":"2026-05-27T01:28:15Z","title":"EgoBench: An Interactive Egocentric Multimodal Benchmark for Tool-Using Agents","version":1},"cited_work":{"arxiv_id":"2605.27820","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.27820","snapshot_observed_at":"2026-08-14T04:32:55.029021Z","title":"EgoBench: An Interactive Egocentric Multimodal Benchmark for Tool-Using Agents","venue":"cs.AI","work_id":"7ceb12c7-531d-495d-82e0-bbe593665c15","year":2026},"citing_paper":{"arxiv_id":"2608.08700","last_updated":"2026-08-09T13:25:54Z","snapshot_observed_at":"2026-08-20T07:24:22.827004Z","submitted_at":"2026-08-09T13:25:54Z","title":"PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:54.324508Z"},"links":{"cited_paper":"/paper/2605.27820","citing_paper":"/paper/2608.08700"},"observation_digest":"sha256:5bd9808b425a18af41913c2ce22deb0aea229ebc09f0132d509aeb58539ee7a3","observation_id":"2035427f-27f2-473d-beda-21829b02f35a","resolution":{"observed_at":"2026-08-14T04:32:55.036595Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05366","last_updated":"2026-06-28T19:14:17Z","snapshot_observed_at":"2026-08-16T12:07:54.676722Z","submitted_at":"2026-01-08T20:44:28Z","title":"Lost in Execution: On the Multilingual Robustness of Tool Calling in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05366","snapshot_observed_at":"2026-08-14T04:32:54.330550Z","title":"InFindings of the Association for Computational Linguistics: NAACL 2025, 1160–1183","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08700","last_updated":"2026-08-09T13:25:54Z","snapshot_observed_at":"2026-08-20T07:24:22.827004Z","submitted_at":"2026-08-09T13:25:54Z","title":"PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:54.330550Z"},"links":{"cited_paper":"/paper/2601.05366","citing_paper":"/paper/2608.08700"},"observation_digest":"sha256:ba430a0a46d42551740553afb8bdc70d38c9f019eb69ba11b319bb09681d7822","observation_id":"e5e5bc9f-df7b-4540-88cc-0d2916e0ceb1","resolution":{"observed_at":"2026-08-14T04:32:54.330550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:54.336410Z","title":"Patil,S.G.;Mao,H.;Yan,F.;Ji,C.C.-J.;Suresh,V.;Stoica, I.; and Gonzalez, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08700","last_updated":"2026-08-09T13:25:54Z","snapshot_observed_at":"2026-08-20T07:24:22.827004Z","submitted_at":"2026-08-09T13:25:54Z","title":"PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:54.336410Z"},"links":{"citing_paper":"/paper/2608.08700"},"observation_digest":"sha256:3a605a0a86f951fb33f445d868035b731e8c62ad2c3e7c6bb271013f3247a1c4","observation_id":"1b0dff53-319d-4e8b-8ee3-5dc3292f1720","resolution":{"observed_at":"2026-08-14T04:32:54.336410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14992","last_updated":"2024-05-26T22:27:23Z","snapshot_observed_at":"2026-08-17T02:59:38.954198Z","submitted_at":"2024-02-22T22:05:23Z","title":"tinyBenchmarks: evaluating LLMs with fewer examples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14992","snapshot_observed_at":"2026-08-14T04:32:54.342840Z","title":"Qin, Y.; Liang, S.; Ye, Y.; Zhu, K.; Yan, L.; Lu, Y.; Lin, Y.; Cong,X.;Tang,X.; Qian,B.;etal.2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08700","last_updated":"2026-08-09T13:25:54Z","snapshot_observed_at":"2026-08-20T07:24:22.827004Z","submitted_at":"2026-08-09T13:25:54Z","title":"PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:54.342840Z"},"links":{"cited_paper":"/paper/2402.14992","citing_paper":"/paper/2608.08700"},"observation_digest":"sha256:0ef60b9a25f94b982c0e11fc3011475ecb11a10f9d72a6de16f7158f99196728","observation_id":"7ece5b65-2ced-4172-9e15-f43d12056726","resolution":{"observed_at":"2026-08-14T04:32:54.342840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-14T04:32:54.350401Z","title":"Srinivasan, V","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08700","last_updated":"2026-08-09T13:25:54Z","snapshot_observed_at":"2026-08-20T07:24:22.827004Z","submitted_at":"2026-08-09T13:25:54Z","title":"PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:54.350401Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2608.08700"},"observation_digest":"sha256:aa8f610d172cc18af572b21af4f19ddecdf9ee6f49d6d1baaa44711e76d38175","observation_id":"9c643d66-58b5-462d-ade7-7083ae51ab5d","resolution":{"observed_at":"2026-08-14T04:32:54.350401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-14T04:32:54.355662Z","title":"Trivedi, H.; Khot, T.; Hartmann, M.; Manku, R.; Dong, V.; Li, E.; Gupta, S.; Sabharwal, A.; and Balasubramanian, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08700","last_updated":"2026-08-09T13:25:54Z","snapshot_observed_at":"2026-08-20T07:24:22.827004Z","submitted_at":"2026-08-09T13:25:54Z","title":"PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:54.355662Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2608.08700"},"observation_digest":"sha256:abc7a8235adb0247892d6de094a16df04662c60595045d1e7eba91b031c31489","observation_id":"1cd76f9b-0f4a-4cec-a059-986c3f26185e","resolution":{"observed_at":"2026-08-14T04:32:54.355662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:54.362365Z","title":"Wang,X.;Wei,J.;Schuurmans,D.;Le,Q.;Chi,E.;Narang, S.; Chowdhery, A.; and Zhou, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08700","last_updated":"2026-08-09T13:25:54Z","snapshot_observed_at":"2026-08-20T07:24:22.827004Z","submitted_at":"2026-08-09T13:25:54Z","title":"PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:54.362365Z"},"links":{"citing_paper":"/paper/2608.08700"},"observation_digest":"sha256:40b3882bb19c19fa4250503c16bc20c843c4ba956c8dcfd5179315f51dbc1ba3","observation_id":"3a74fb33-070c-470c-a50e-5ef13408e319","resolution":{"observed_at":"2026-08-14T04:32:54.362365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:54.374135Z","title":"arXiv preprint arXiv:2606.19348","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08700","last_updated":"2026-08-09T13:25:54Z","snapshot_observed_at":"2026-08-20T07:24:22.827004Z","submitted_at":"2026-08-09T13:25:54Z","title":"PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:54.374135Z"},"links":{"citing_paper":"/paper/2608.08700"},"observation_digest":"sha256:93ef26169e21f60633eab48ad79100dca2a6d3cc99845eb66ea24b86000a73af","observation_id":"232459a5-a665-42c3-b7e7-09f51d89b5fc","resolution":{"observed_at":"2026-08-14T04:32:54.374135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-17T20:31:29.818313Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-14T04:32:54.386715Z","title":"Yao,S.;Zhao,J.;Yu,D.;Shafran,I.;Narasimhan,K.R.;and Cao, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08700","last_updated":"2026-08-09T13:25:54Z","snapshot_observed_at":"2026-08-20T07:24:22.827004Z","submitted_at":"2026-08-09T13:25:54Z","title":"PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:54.386715Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2608.08700"},"observation_digest":"sha256:3c7226b3df074f25043bb973920f3046e20b8fa427a97691da427dff727ff5ef","observation_id":"2efe832a-ca61-4f12-9d6a-f801e717b829","resolution":{"observed_at":"2026-08-14T04:32:54.386715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:55.205237Z","title":"InNeurIPS 2022 Foundation Models for Decision Making Workshop","venue":null,"work_id":"9013ae78-a255-4df2-beba-8f0216cad08e","year":2022},"citing_paper":{"arxiv_id":"2608.08700","last_updated":"2026-08-09T13:25:54Z","snapshot_observed_at":"2026-08-20T07:24:22.827004Z","submitted_at":"2026-08-09T13:25:54Z","title":"PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:54.401650Z"},"links":{"citing_paper":"/paper/2608.08700"},"observation_digest":"sha256:bd82ce153b07a9927e3eab7e01a1fbad956ce38e112e83b00c58f5e05a3d978d","observation_id":"405c0d3f-c382-4837-a7a2-e13c69f533fa","resolution":{"observed_at":"2026-08-14T04:32:55.211557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:55.175725Z","title":"InInternational Conference on Learning Representations, volume 2025, 102351–102390","venue":null,"work_id":"c2484641-f2a3-43bd-a527-358effce79b4","year":2025},"citing_paper":{"arxiv_id":"2608.08700","last_updated":"2026-08-09T13:25:54Z","snapshot_observed_at":"2026-08-20T07:24:22.827004Z","submitted_at":"2026-08-09T13:25:54Z","title":"PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:54.406883Z"},"links":{"citing_paper":"/paper/2608.08700"},"observation_digest":"sha256:b9cf8e7459fbb7c9cc025eedf1330deaad50533dca7261f67f66599de3e844d7","observation_id":"5b96ea07-d496-4c5e-bf4e-26f468aa8126","resolution":{"observed_at":"2026-08-14T04:32:55.185449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.05515","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:54.535213Z","title":"Zheng, L.; Chiang, W.-L.; Sheng, Y.; Zhuang, S.; Wu, Z.; Zhuang, Y.; Lin, Z.; Li, Z.; Li, D.; Xing, E.; et al","venue":null,"work_id":"7dcae4e4-d76c-4276-9aa7-c5bd7e3f2dba","year":null},"citing_paper":{"arxiv_id":"2608.08700","last_updated":"2026-08-09T13:25:54Z","snapshot_observed_at":"2026-08-20T07:24:22.827004Z","submitted_at":"2026-08-09T13:25:54Z","title":"PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:54.413371Z"},"links":{"citing_paper":"/paper/2608.08700"},"observation_digest":"sha256:cf21f155ea888c12df14eb59b034ad9f8860378016f99485a88080d76e58800b","observation_id":"107ca167-ae3e-430e-aaa1-3f37a594b991","resolution":{"observed_at":"2026-08-14T04:32:54.547984Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-14T04:32:54.367940Z","title":"arXiv preprint arXiv:2203.11171","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08700","last_updated":"2026-08-09T13:25:54Z","snapshot_observed_at":"2026-08-20T07:24:22.827004Z","submitted_at":"2026-08-09T13:25:54Z","title":"PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:54.367940Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2608.08700"},"observation_digest":"sha256:94bb2af113c1deaa4cacee19d4bc3ddb26c330b28b72655c735d2bf71d1922ce","observation_id":"c4242ccb-9f98-4981-abca-89cd1e644b8d","resolution":{"observed_at":"2026-08-14T04:32:54.367940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:55.230728Z","title":"InProceedings of the 2023 conference on empirical methods in natural language processing, 3102–3116","venue":null,"work_id":"752c03f7-822f-4bff-8f00-1152dfc84831","year":2023},"citing_paper":{"arxiv_id":"2608.08700","last_updated":"2026-08-09T13:25:54Z","snapshot_observed_at":"2026-08-20T07:24:22.827004Z","submitted_at":"2026-08-09T13:25:54Z","title":"PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:54.314051Z"},"links":{"citing_paper":"/paper/2608.08700"},"observation_digest":"sha256:d20821c5a608559da3cf0e7c2cb79d6704c0edf3677d98a418bd1a4a2beeb0ee","observation_id":"4b353d32-9f69-45bc-a1f0-83d90dc68d71","resolution":{"observed_at":"2026-08-14T04:32:55.237855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:55.252426Z","title":"Kim,D.;Ren,Z.;Hao,J.;Sun,Z.;Wang,L.;Ma,X.;Ye,Z.; Han, X.; Yin, J.; Ji, H.; et al","venue":null,"work_id":"393bd2b5-cf70-4ccd-9daf-86e0f4f69041","year":2024},"citing_paper":{"arxiv_id":"2608.08700","last_updated":"2026-08-09T13:25:54Z","snapshot_observed_at":"2026-08-20T07:24:22.827004Z","submitted_at":"2026-08-09T13:25:54Z","title":"PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:54.295232Z"},"links":{"citing_paper":"/paper/2608.08700"},"observation_digest":"sha256:6fb3fe476f0d395746a96015f54b3794e8480ff1d98d3d42cc79c7551d2371e4","observation_id":"1c61da75-4c2a-4d7b-ae5d-2643cc21b5db","resolution":{"observed_at":"2026-08-14T04:32:55.262298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:55.276635Z","title":"InProceedings of the 2025 Conference on Empirical Methods in Natural Language Processing, 33526–33535","venue":null,"work_id":"0df08d3e-0f3c-48c4-9a9d-3ae57740b27c","year":2025},"citing_paper":{"arxiv_id":"2608.08700","last_updated":"2026-08-09T13:25:54Z","snapshot_observed_at":"2026-08-20T07:24:22.827004Z","submitted_at":"2026-08-09T13:25:54Z","title":"PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:54.287491Z"},"links":{"citing_paper":"/paper/2608.08700"},"observation_digest":"sha256:fa7956a669c83822f4d248f98f7074f1fecda23ef06f58aacfb87051c0f4c4bf","observation_id":"aef55e00-8030-495c-9321-2b2fbccf96bb","resolution":{"observed_at":"2026-08-14T04:32:55.282603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-08-14T06:34:01.114459Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-14T04:32:54.281242Z","title":"https://www.anthropic","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08700","last_updated":"2026-08-09T13:25:54Z","snapshot_observed_at":"2026-08-20T07:24:22.827004Z","submitted_at":"2026-08-09T13:25:54Z","title":"PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:54.281242Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2608.08700"},"observation_digest":"sha256:0b6c7c10c2897d8b91f377bcc9d94d304efff97b5a0c8bdc210c6425a2a888e2","observation_id":"b82de072-7f20-4029-a50b-62c3d5876d69","resolution":{"observed_at":"2026-08-14T04:32:54.281242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08700","last_updated":"2026-08-09T13:25:54Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-20T07:24:22.827004Z","submitted_at":"2026-08-09T13:25:54Z","title":"PluginEval: A Diagnostic Benchmark for Fine-Grained Error Attribution in Function Calling"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2608.08700."}