{"as_of":"2026-08-08T20:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cf614bbcb2d588262479e810b0e73b51585a61d58fdc86243f4424dfaaccaf87","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T10:41:33.954036Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04974/citation-record","integrity":"/paper/2607.04974/integrity","json":"/paper/2607.04974/citation-record.json","paper":"/paper/2607.04974"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"MARS: toward more eﬀicient multi-agent collaboration for LLM reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:8043acfd735eb88a458b29cd47a16fc0aa86f2d3e5f5a0e39e74bd61452aa769","observation_id":"8f0f7e36-4143-4acb-a312-b134b64a09b4","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Agentic reasoning: A streamlined framework for enhancing LLM reasoning with agentic tools,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:cfc07c2c107bab26e769704d0c1d99331c1ec43b49cf2689c4e903bce534506f","observation_id":"e3a3f973-2cdd-43a7-8c98-408ab8cbdce7","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01489","last_updated":"2024-10-29T17:29:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T17:24:45Z","title":"Agentless: Demystifying LLM-based Software Engineering Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01489","snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Agentless: Demystifying llm-based software engineering agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"cited_paper":"/paper/2407.01489","citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:335b8fb7d77af03d3e3a9bc71f25e5eff137740b45467d328be114315d63c04f","observation_id":"f9670a87-8967-49b8-9959-47f6a599400c","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Au- tocoderover: Autonomous program improvement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:8d83f889a41883031892b013b9d6d127e6325dcde6bb25f428a393e0641565ec","observation_id":"66712ed1-fce7-427d-b942-dcd4e8bc84eb","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Openhands: An open platform for AI software developers as generalist agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:b133a5c01b034cf275c587d3623945d10673ab27117fd6e4d2b347021e87b3cf","observation_id":"b35d3def-a816-4c9f-9dbb-5dd4aa0adabe","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15787","last_updated":"2026-05-26T14:29:34Z","snapshot_observed_at":"2026-08-06T19:45:43.643644Z","submitted_at":"2024-08-28T13:29:59Z","title":"Interactive Agents: Simulating Counselor-Client Psychological Counseling via Role-Playing LLM-to-LLM Interactions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15787","snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Interactive agents: Simulating counselor- client psychological counseling via role-playing llm-to-llm inter- actions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"cited_paper":"/paper/2408.15787","citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:6cd726fe15ac85a286977838d7ef93c4894946169380defebc87944cd2fc9f4a","observation_id":"a2b5a9bc-c48b-4c68-9ece-16febb62b916","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01415","last_updated":"2023-12-05T05:26:29Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:57Z","title":"GPT-Driver: Learning to Drive with GPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01415","snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Gpt-driver: Learning to drive with GPT,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"cited_paper":"/paper/2310.01415","citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:df32b3655a5841b31e2f34e47b1455aa45cad8912f6d07aecd774522a58f166c","observation_id":"31fd7824-496d-4a0f-9e24-636907d9aede","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Drive like a human: Rethinking autonomous driving with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:fe7426dd0bdcd4958ecab235fcf45568ed382511757c54d9202b015bc746d132","observation_id":"506810c6-068d-4d4d-ac28-56ff195573b5","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05332","last_updated":"2023-11-28T09:47:57Z","snapshot_observed_at":"2026-07-06T16:45:11.604296Z","submitted_at":"2023-11-09T12:58:37Z","title":"On the Road with GPT-4V(ision): Early Explorations of Visual-Language Model on Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05332","snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"On the road with gpt-4v(ision): Early explorations of visual-language model on autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"cited_paper":"/paper/2311.05332","citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:bcc60ca066a9c354bcdfe181ee296bb64b73251218c478dcabd8cee6e7173711","observation_id":"7f97823f-4bd8-48f0-aaec-9b1c21057eed","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"MP5: A multi-modal open-ended embodied system in minecraft via active perception,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:43f94403d54e878fa1fed30bc2e09e93fb69f14802d0ae335a2f2fadde4763a4","observation_id":"52155cf8-2c7c-4e20-a125-1cb2b1977808","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"JAR VIS-1: open- world multi-task agents with memory-augmented multimodal language models,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:7690485a59f28485c2b349aeff4599f6b7dd9ea640ce88b901b5586881cab67c","observation_id":"5405b8b9-5861-4451-9ab7-984d176c8a76","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Embodied multi-modal agent trained by an LLM from a parallel textworld,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:94d82ec163b52b58034a67e652ab911e84dc40fee8a82caccbbbde4731e50029","observation_id":"1335a719-6ab0-4712-8b26-e5690532dd0f","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01560","last_updated":"2024-07-08T05:56:47Z","snapshot_observed_at":"2026-08-02T14:50:04.461434Z","submitted_at":"2023-02-03T06:06:27Z","title":"Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01560","snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Describe, explain, plan and select: Interactive planning with large lan- guage models enables open-world multi-task agents,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"cited_paper":"/paper/2302.01560","citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:93eb9929a8e5f22ca71300d5b9c1e680ef5c93901537ef3f79d347420fe8d8c1","observation_id":"67fd4373-11be-46ef-aa67-fa188f970de0","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Webwise: Unlocking web interface control for llms via sequential exploration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:b099d0d7b8da5b6e524e81ae76e5311d8af89590c1ec0261f6b55f1d55b8119c","observation_id":"12c60fe1-691c-444c-9c38-7c5c9c2b3e6f","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.15272","last_updated":"2024-03-09T09:38:51Z","snapshot_observed_at":"2026-07-31T08:40:31.844458Z","submitted_at":"2023-08-29T13:02:30Z","title":"AutoDroid: LLM-powered Task Automation in Android","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.15272","snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Empowering LLM to use smartphone for intelligent task automation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"cited_paper":"/paper/2308.15272","citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:a2e684e27c8e1935c7e60e4e785f5c12162449a269ddd60a4d5052f917569a71","observation_id":"62e69a25-5de6-4379-a507-7bac69b372f8","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07562","last_updated":"2023-11-13T18:53:37Z","snapshot_observed_at":"2026-07-06T16:46:57.403995Z","submitted_at":"2023-11-13T18:53:37Z","title":"GPT-4V in Wonderland: Large Multimodal Models for Zero-Shot Smartphone GUI Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07562","snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"GPT-4V in wonderland: Large multimodal models for zero- shot smartphone GUI navigation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"cited_paper":"/paper/2311.07562","citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:e3f3ebb8e9618a204f77b0518bce9c7619a716c078e564596f1f08cb3a8261be","observation_id":"371fd33c-1012-40a5-9904-19bbd25c4142","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"You only look at screens: Multimodal chain-of-action agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:de72d5dd9218fdd222ffb36f11a127cae379e0933ed4a0df865eb064f9010e41","observation_id":"9331f783-6026-475a-85e8-f4b4c52aea9c","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Collision between vehicle controlled by developmental automated driving system and pedestrian,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:35c8974d724bb82cbe7ea601f22e03df28a4089bf25375e0e13a85390c6279c7","observation_id":"bf6d669d-1fbd-48ec-9da3-8c41612349b6","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Microsoft’s ai agent spends 100% of its testing funds on online fraud—lessons for msft and ai-secured transactions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:8987b48b8710781f9875bbdb53dcdb503f6919870c5463929d09a68bcd1bb00f","observation_id":"24606737-970d-4939-93e7-deb25a7c63d5","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Chatgpt agent exposes vulnerability, potentially al- lowing “shadow leak","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:beba795d1a0a1bddb58c0717513ebbd16ccdd470276f392f539ee2a6b129ab23","observation_id":"1c69e99b-e31b-434d-8bd6-c09b6f61d355","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Security debt in llm agent applications: A measurement study of vulnerabilities andmitigation trade-offs,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:bd1d44dc8931dada4f935b54d4ec9c371d289ae7ab53bff207756016042beebb","observation_id":"63595d95-1cf0-4faf-a3eb-c00e785de562","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Eu- agent-bench: Measuring illegal behavior of LLM agents under EU law,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:5920618c9dd7ce5bf737710410c140fc575c88bb1d148cbe1f1ed4d74411e62e","observation_id":"c52e18e5-89d6-4526-8a8e-2a058555a8da","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Can agents fix agent issues?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:9c9ba6fdfb5918bbdc13c27d0518674fcd92cf5bec8341b258dce0817db9e4ba","observation_id":"044fb42a-54c3-4439-bd51-8977817b350c","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Where LLM agents fail and how they can learn from failures,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:06b7bad4f05de1fe89950dcf9159a616872c0a97cffa30c640fd7557c0999a19","observation_id":"a960a2a7-f90e-4b6b-b11f-bb6802eebbf8","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Understanding software engineering agents: A study of thought-action-result trajectories,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:e53026a23bb8c7e14ae55cbf75a2b66878bd7595eebc0f3b2455a1aef01e07f5","observation_id":"4c98062c-cc03-4ee8-b1cf-f2cb4e182a60","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08311","last_updated":"2026-05-27T03:57:09Z","snapshot_observed_at":"2026-08-07T05:11:22.076864Z","submitted_at":"2025-06-10T00:41:54Z","title":"Understanding Automated Program Repair Agents Through the Lens of Traceability: An Empirical Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08311","snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Understanding software engineering agents through the lens of traceability: An empirical study,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"cited_paper":"/paper/2506.08311","citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:ac21b1fe093f50053584b0fe937be0768858f0a902e54a6e3c5b8e1f7198dc36","observation_id":"48cdf4ec-d62c-4dd6-be74-3d4a8525d164","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Exploring autonomous agents: A closer look at why they fail when completing tasks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:dba014c20f5d7b6f4a521d33ec6cc8781e226d714c274594e3a51386e1977555","observation_id":"bdf7d7dd-97bd-4548-9add-ce33fcfe22eb","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23694","last_updated":"2026-06-03T04:13:57Z","snapshot_observed_at":"2026-08-04T14:43:33.365212Z","submitted_at":"2025-09-28T07:05:17Z","title":"SafeSearch: Automated Red-Teaming of LLM-Based Search Agents","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23694","snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Safesearch: Automated red-teaming for the safety of llm-based search agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"cited_paper":"/paper/2509.23694","citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:adf86eafb8b9035a18aad27ecf8649e2aee549a9914bfa09379e8d3e614e9675","observation_id":"11b33f00-f64a-4468-921b-1f02e64faa29","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13657","last_updated":"2025-10-26T23:25:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-17T19:04:38Z","title":"Why Do Multi-Agent LLM Systems Fail?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13657","snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Why do multi-agent LLM systems fail?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"cited_paper":"/paper/2503.13657","citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:76e68bd59765d2caa4b7f184c12ef209110da9cbfbca873e397abbf60e1c6bbe","observation_id":"a56b285e-e048-45c7-9830-be3c609ef3bd","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Diagnosing failure root causes in platform-orchestrated agentic systems: Dataset, taxonomy, and benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:685470e0c550f98c23283d2b1195c7d0a54f7d7f701b4877c1b9485f3479f47f","observation_id":"50752fba-2576-49da-bfd3-52c6c730a3b0","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15116","last_updated":"2024-02-23T06:04:23Z","snapshot_observed_at":"2026-07-06T17:34:24.337596Z","submitted_at":"2024-02-23T06:04:23Z","title":"Large Multimodal Agents: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15116","snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Large multi- modal agents: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"cited_paper":"/paper/2402.15116","citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:dcf7a124d6f63241659b7eb510ae679e07338175e105eec5e06388104661d2ab","observation_id":"260ad4bc-e197-4cd7-86f6-40fdef60b238","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Large language model for verilog code generation: Literature review and the road ahead,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:5c61b102f922c6c410892689b81bd23692d2c630ac89d2cb84ed0746ef6517fd","observation_id":"d42ca417-eb0e-405d-a573-bb70d2c78327","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Identifying relevant studies in software engineering,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:d764ebfe8c78dde9f6d7071e21fccbd3c98b38d36c2c9132f491f2f42979686c","observation_id":"263a4b34-d26c-49a6-8a71-fd826b4c62ee","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Guidelines for snowballing in systematic literature studies and a replication in software engineering,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:07727189a693de1fd21484c42d202927bd9fd8763f65c6c9658229bec2daea56","observation_id":"5254d7b8-b47e-49ec-8ddb-0f350eadfec6","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"A comprehensive study of autonomous vehicle bugs,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:004c16357963632b913218894f4e75a1a0b6782a88c1b0a40b094aa3fafcc24c","observation_id":"1ffd2ac0-2a66-43ed-ab1d-42d79d2c8bac","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Faults in deep reinforcement learning programs: a taxonomy and a detection approach,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:47c8623ace5d02aa378c65421ab3d0511d3ff1bd8de35213c1b60808896b5541","observation_id":"f5769b8c-703f-4d2e-bb40-a07a0ab6daad","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"A comprehensive study of deep learning compiler bugs,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:9b097a4b0bd2dfd436093b7b520d058c7ec1b16fa7f2dbee571e9db0a894283c","observation_id":"ff2ff986-9d13-4c51-8f10-0075bad99bb4","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Catiss: An intelligent tool for categorizing issues re- ports using transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:62778ffe8e7f78b33d3a3d38acad2afa60a423999abde1f78be315ac8a34ca3a","observation_id":"ce0376f0-5f4b-454a-8795-5a569f6d2d19","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Analysis and detection of information types of open source software issue discussions,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:554bf6cc7e9c7a4207744819bbebecea4b2cc5d3582bb3b706115ea342c81ebf","observation_id":"246ea148-9c06-4ed0-85bd-eece2e8590ce","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Bug characteristics in open source software,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:de091d117e8e188643fcf08c08a7de7b4e953072a3a512129606715bb2e5aec9","observation_id":"076ab9e2-2bb4-4632-b967-38d3694e84e5","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Cohen’s kappa coeﬀicient as a performance measure for feature selection,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:2ac37bd28feb315f06197549af3f974064fa227b5bc66bf21d12aa052a76a75b","observation_id":"35868528-347e-4fea-9e07-82a1132f5a57","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"CCFQA: A benchmark for cross-lingual and cross- modal speech and text factuality evaluation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:bd1e0c7ef653a2a7bc7e475b455378bb9a2fe63fbd4b5f9d3574dfc6ff0c80b6","observation_id":"d09dab8a-1887-4426-94d6-6055c417098c","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Matester","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:e2bdc7e616742613d56c0e8b5a5bc39e17a697da38eb9f7f816accdf0d5057ce","observation_id":"6609a772-7c84-41f6-bd89-673a498deee9","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Appagent: Multimodal agents as smartphone users,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:85e235751897b8bee84cde64376576b3942e23a47b248f67e3c264b080700d6b","observation_id":"cac71897-47e6-46f2-a389-fefc34f488ad","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07061","last_updated":"2024-01-07T08:23:47Z","snapshot_observed_at":"2026-07-06T15:15:42.652360Z","submitted_at":"2023-04-14T11:31:56Z","title":"DroidBot-GPT: GPT-powered UI Automation for Android","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07061","snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Droidbot-gpt: Gpt-powered UI automation for android,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"cited_paper":"/paper/2304.07061","citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:d041db758f2f98021fcbf650c59ae53611497c381d348ad0581b2ccd83026f81","observation_id":"31d1f995-d905-4cbf-800b-3ede6564f241","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Mobilegpt: Augmenting LLM with human-like app memory for mobile task automation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:8bccf94783dce49090caee41241712fc42e8a492e7f3adbc0ba6dbe9011b3075","observation_id":"f28a6a95-cc69-48b8-9aa0-3d3338680798","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13108","last_updated":"2024-01-01T14:26:39Z","snapshot_observed_at":"2026-07-06T17:06:00.378648Z","submitted_at":"2023-12-20T15:28:38Z","title":"ASSISTGUI: Task-Oriented Desktop Graphical User Interface Automation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13108","snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"ASSISTGUI: task-oriented desktop graphical user interface automation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"cited_paper":"/paper/2312.13108","citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:7178755dbaf803ee8b7616c995932e08d5e308482326d29c5a6ff29a2a3171f6","observation_id":"79c35e9d-a35e-423d-bc09-1b69f2c796ff","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Browsing like human: A multimodal web agent with experien- tial fast-and-slow thinking,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:bddc4f2580cdafd7a879230c5fbb68ca7f1386ce7acceb95e73f30947a814586","observation_id":"5f66734e-2b27-495c-9cfe-fb6d953a10d1","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Octopus: Embodied vision-language programmer from environmental feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:ad14fe2dd603ee66023c025cc9fd58092dee93a37c484550f716cb3a25f48d3e","observation_id":"ecf703b3-f86f-4838-9456-4f428aae7cdd","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"See and think: Embodied agent in virtual environment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:665a6f53445d56d227a1ec65fb19fc2802f513f0805d4a2dd427da1b6a23c558","observation_id":"3e492c2d-bdfd-43d5-96ef-53f709d77063","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Open-world planning via lifted regression with llm-inferred affordances for embodied agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:b936249667ae5fcd3d59dde5aebed106c483987b26e69f502443cdd4899c1b35","observation_id":"8b49a3cc-2217-40e7-8226-e6e2e79ffc8c","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Citynavagent: Aerial vision-and- language navigation with hierarchical semantic planning and global memory,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:d350b1029b5231d6e4a2a7a89d455af2fb4e9c63108905a672e66eeadc7a4b34","observation_id":"22576506-450a-448f-94dc-d2ae73cef06d","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"RILA: reflective and imaginative language agent for zero-shot semantic audio-visual navigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:a8e594583f6a8c73585adf8f066cfbe3e588bad34504bb80d8d3c9686725fd68","observation_id":"49d177c1-d310-4a85-a1c9-03cfcff5b6f4","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00571","last_updated":"2023-11-01T15:13:43Z","snapshot_observed_at":"2026-07-06T16:41:43.009493Z","submitted_at":"2023-11-01T15:13:43Z","title":"LLaVA-Interactive: An All-in-One Demo for Image Chat, Segmentation, Generation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00571","snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Llava- interactive: An all-in-one demo for image chat, segmentation, generation and editing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"cited_paper":"/paper/2311.00571","citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:727c1190d3df7ca3f5c41c1b49dd389537a6d683150ef5c2a2d213b0ecde55df","observation_id":"9d9f1967-9619-4e5d-b923-c34257ae8a5a","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:214d24b2754dec52fe00cb30843941cec4ed906405f8a17312ab0cb7a1a347ed","observation_id":"746377dd-ed62-4931-93ce-2d2f922096ca","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Genartist: Multimodal LLM as an agent for unified image generation and editing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:fcc6bbac559139a5dfc49aa5094056e86ec3c8b37c40951f8952384935daff39","observation_id":"7af3603d-494f-4f1c-bd01-db6bec3a32f0","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12404","last_updated":"2024-08-29T19:08:54Z","snapshot_observed_at":"2026-08-05T05:51:24.518659Z","submitted_at":"2023-10-19T01:20:12Z","title":"Loop Copilot: Conducting AI Ensembles for Music Generation and Iterative Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12404","snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Loop copilot: Conducting AI ensembles for music generation and iterative editing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"cited_paper":"/paper/2310.12404","citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:83acb68c4d75220a0aa4c568469f14568b700a8b82c6e60923912ccfc84b2b23","observation_id":"fd0920c3-ab5a-44c6-89b2-04731b33e30d","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Musicagent: An AI agent for music understanding and generation with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:c04144c5057e0220c9c20a1d84ffdc46e6b508272e31d00c14799cb4181300fa","observation_id":"8e2f2a50-6a1d-47d8-8b6e-549dd9fdec0f","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14335","last_updated":"2023-11-26T14:12:37Z","snapshot_observed_at":"2026-07-06T15:58:55.330444Z","submitted_at":"2023-07-26T17:54:04Z","title":"WavJourney: Compositional Audio Creation with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14335","snapshot_observed_at":"2026-07-11T10:41:33.954036Z","title":"Wavjourney: Compositional audio creation with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-11T10:41:33.954036Z"},"links":{"cited_paper":"/paper/2307.14335","citing_paper":"/paper/2607.04974"},"observation_digest":"sha256:8eb766127fea53c18ca858b0e9a7b0ef2ce7c3b4aa57f28820714c59d78ba9b2","observation_id":"ca2d2db1-2031-469e-87e7-bc8d8cb18bea","resolution":{"observed_at":"2026-07-11T10:41:33.954036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04974","last_updated":"2026-07-06T12:04:49Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-03T03:48:32.816586Z","submitted_at":"2026-07-06T12:04:49Z","title":"A Comprehensive Study of Implementation Bugs in Multi-modal Agents"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2607.04974."}