{"as_of":"2026-08-06T03:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ebe9a0fb25c6d8968df0c7ce49423818990ecbc41ca138b8757cf1e467f96305","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:29:25.650175Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.12896/citation-record","integrity":"/paper/2604.12896/integrity","json":"/paper/2604.12896/citation-record.json","paper":"/paper/2604.12896"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Per- ception tokens enhance visual reasoning in multimodal lan- guage models","venue":null,"work_id":"7b1356ed-a728-40d5-8631-fa3494d4cc17","year":2025},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:03ee909ac16a8e7aab0889c7f855621a58d87dfb341b7f1a29f33653cde470e8","observation_id":"4d716c47-5f46-4c19-8567-f92b4aecbce5","resolution":{"observed_at":"2026-05-17T23:25:29.685588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13180","last_updated":"2025-07-23T19:22:35Z","snapshot_observed_at":"2026-08-01T20:25:06.490113Z","submitted_at":"2025-04-17T17:59:56Z","title":"PerceptionLM: Open-Access Data and Models for Detailed Visual Understanding","version":3},"cited_work":{"arxiv_id":"2504.13180","doi":"10.48550/arxiv.2504.13180","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceptionlm: Open-access data and models for detailed visual understanding","venue":"ArXiv.org","work_id":"e81d25ef-bd13-473f-8fc5-0cf3dc3af528","year":2025},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"cited_paper":"/paper/2504.13180","citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:97a73975ae622749ef775c6d46d5bef7b322ad458d0461a43c23f7efdb1ec049","observation_id":"303a81e6-0a18-414c-a1da-9dcd0f3f3662","resolution":{"observed_at":"2026-05-11T10:26:02.000635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:d44a2e1aa786d1afec3e2115462a6abb6be6782f4d000ef45c67dc9a3e3f2c02","observation_id":"af90f8ee-3e68-4ed5-813e-664d3890c303","resolution":{"observed_at":"2026-05-11T10:26:01.983777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-07-06T20:12:31.283474Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"cited_work":{"arxiv_id":"2412.18072","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18072","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2412.18072 , year=","venue":null,"work_id":"2f5b3555-f99f-49e0-b3d4-a0cf317d2df0","year":2024},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"cited_paper":"/paper/2412.18072","citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:624a7e6c193f64bdf77d2bc43a3ddfa1a078f98d33f6c8c4b3b025fe499e3de5","observation_id":"bdb2de89-3591-442e-b628-56222da10caf","resolution":{"observed_at":"2026-05-11T10:26:01.993879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15879","last_updated":"2026-05-09T18:01:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T17:54:49Z","title":"GRIT: Teaching MLLMs to Think with Images","version":2},"cited_work":{"arxiv_id":"2505.15879","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15879","snapshot_observed_at":"2026-07-11T03:17:51.507547Z","title":"GRIT: Teaching MLLMs to Think with Images","venue":"cs.CV","work_id":"0a45eb3d-cd3b-4535-9626-ac689cfff7e1","year":2025},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"cited_paper":"/paper/2505.15879","citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:3941df3855b591c0e10c88c8f56b0f1adaff65ce5453a77f57d35fc253311cdd","observation_id":"e2acb4af-17dc-4eab-ab7c-239ce84866ee","resolution":{"observed_at":"2026-05-12T02:44:46.816923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hidden in plain sight: Vlms overlook their visual repre- sentations","venue":null,"work_id":"5e1e977f-0a11-47a8-8ec8-11bbbc41bd5d","year":2025},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:98f561448f44e49310419abc0071bb6ca79ffdad16afb16ff247d274b0c04d59","observation_id":"0c876103-aa47-44f8-b5d4-3bc3c96474ea","resolution":{"observed_at":"2026-05-17T23:25:29.688708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llmdet: Learning strong open-vocabulary object detectors under the supervision of large language models","venue":null,"work_id":"d1d57910-5452-4b37-aedd-fb5cdc09514d","year":2025},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:7a835e69d4f5cebc543244cc59d64a41adb840f4be3838fc86bb6f287487ec15","observation_id":"23821e26-51d2-4539-a125-a4e668480c5e","resolution":{"observed_at":"2026-05-17T23:25:29.691861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Blink: Multimodal large language mod- els can see but not perceive","venue":null,"work_id":"09ab907a-6d7f-4371-b461-87052f9d4227","year":2024},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:090118e94f4992f5348335ab8785879d5b6cc61f9f9272a60f3d7f9ffc69ca03","observation_id":"61f3ea5c-202e-48f5-ae94-beaef5b02923","resolution":{"observed_at":"2026-05-17T23:25:29.695215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual program- ming: Compositional visual reasoning without training","venue":null,"work_id":"f0467a77-506b-440d-9049-8662a2c091fe","year":2023},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:ac8ee6118bec581b871525173df542675dc8760728c0ba5c394d47d25be174d1","observation_id":"248ff6d7-2c0b-40f5-9547-a92a613a5b9b","resolution":{"observed_at":"2026-05-17T23:25:29.698186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vi- sual sketchpad: Sketching as a visual chain of thought for multimodal language models.Advances in Neural Informa- tion Processing Systems, 37:139348–139379","venue":null,"work_id":"05c090f4-5846-4ba0-8fcb-d81e4c21c104","year":2024},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:08fa20eb663c4f63e43b0aabfddf2218f4a11f73e3253783d65ed95deb6c556e","observation_id":"df35a4e1-385a-4265-af30-5d1c0a6d1b66","resolution":{"observed_at":"2026-05-17T23:25:29.682501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.16746","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:17:51.862251Z","title":"Zebra-cot: A dataset for interleaved vision language reasoning","venue":null,"work_id":"dea15336-3efa-4a03-a26a-baa3a38efb90","year":2025},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:8cfbfb6b4e56f08c9e260791cf095f171c5dfaed3c304b875016c6e3c2ace3b7","observation_id":"bf45f232-5d31-45fd-abcb-9c0ea52bc4ee","resolution":{"observed_at":"2026-05-11T10:26:02.008662Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":"7bf297ac-1ab5-4963-a6a2-3dc9ff0d71cc","year":2024},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:3359c522af182a0c0408561096c26ff5b4317b9bbe3d61f31b96e6f6c4bc0239","observation_id":"fb98abb0-49e8-4d7d-a333-73c31baa0d74","resolution":{"observed_at":"2026-05-17T23:25:29.679110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"696f3a43-36d0-4117-a349-beaa91dae180","year":2024},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:20a7926893c0f95cdeb663b114da0f4b1c79e888ab8aeedda2d197d0cb6c69bb","observation_id":"df645dfa-8df4-4b18-811b-69b3acbd51a2","resolution":{"observed_at":"2026-05-17T23:25:29.655114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Latte: Learning to think with vision specialists","venue":null,"work_id":"a695a794-4c0b-4289-b162-8c3ba1d085ff","year":2025},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:f0d964e0565eb63c2fd703be3fc8f9ebc46a7a2fb45c84809e373ddfaa54874f","observation_id":"767e7b78-2c8d-4e9e-a64c-ca61b4e04aa5","resolution":{"observed_at":"2026-05-17T23:25:29.670107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-5 system card","venue":null,"work_id":"93e776db-8704-4e31-89d5-1475cdd491c0","year":2025},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:6104630fce978f17ca75a35b1b2d1ab658c50507b975b65be7d4ac9c7a68d6b8","observation_id":"dcca2f04-7181-4814-8539-f2377c8e7737","resolution":{"observed_at":"2026-05-17T23:25:29.629081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Per- ception test: A diagnostic benchmark for multimodal video models.Advances in Neural Information Processing Systems, 36:42748–42761","venue":null,"work_id":"d0ce7127-8228-41cd-bd90-e6104d7f147d","year":2023},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:82706f8f367e7ca2ab2cebe56c997eb9cb6817fc3b65de629469d6012a5f9a1f","observation_id":"60abb331-28db-486e-a432-73f4ec20ddb8","resolution":{"observed_at":"2026-05-17T23:25:29.631871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-02T04:30:21.704758Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"cited_work":{"arxiv_id":"2505.23678","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23678","snapshot_observed_at":"2026-07-04T19:20:07.271783Z","title":"Grounded Reinforcement Learning for Visual Reasoning","venue":"cs.CV","work_id":"e7be54cd-0b00-4d24-b74f-56621ab7acd4","year":2025},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"cited_paper":"/paper/2505.23678","citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:b55019eaf720a569fdeb6c16e5869de4349dc2cd49efee7befb9c393d11f72ab","observation_id":"ef04fe77-52e5-47ce-b185-40b53d1cc8d0","resolution":{"observed_at":"2026-05-11T10:26:01.973499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Loftr: Detector-free local feature matching with transformers","venue":null,"work_id":"3f5e783f-be5d-451d-aa51-e93a9983b9a8","year":null},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:8bf939829598ad711ca4e6bab657274d9fa504d3952e8f0dfd95089bed916285","observation_id":"ad68073c-d313-45b0-b4ff-760dc9255775","resolution":{"observed_at":"2026-05-17T23:25:29.647855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vipergpt: Vi- sual inference via python execution for reasoning","venue":null,"work_id":"24092bda-e2e7-4981-a708-f874d214c883","year":2023},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:225ac89e111323ccfc7e74979d7d38d2fdbc2b9f050b3e2a47945a92e8d1c656","observation_id":"1400c1a6-5de6-47c5-8590-c7a4e54a5dae","resolution":{"observed_at":"2026-05-17T23:25:29.658284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emergent correspondence from image diffusion.Advances in Neural Information Processing Systems, 36:1363–1389","venue":null,"work_id":"14720275-c603-4ffa-8fe1-dc441e77f31e","year":2023},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:32e8a354c9d6bc7c497f658e4e4e23104a1c0ed6b7a9941587f3d055da660f1b","observation_id":"9519956b-d8d7-4f96-8b4f-8f5bcae686fa","resolution":{"observed_at":"2026-05-17T23:25:29.667044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tulip: Contrastive image-text learning with richer vision understanding","venue":null,"work_id":"40dc5c14-e525-4366-80a1-f79d10272395","year":null},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:6a9a897e3ed66bed3345145a9fa64f38b61bae41079323a540efec1618356008","observation_id":"08a21b56-9925-4bf3-a657-0c4a718ce2b4","resolution":{"observed_at":"2026-05-17T23:25:29.634567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen3 technical report","venue":null,"work_id":"892411a9-ff10-4684-ad8a-19beb192b693","year":2025},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:b84d7141f1d61f3b25f939dea9c3d9767af9d6649d2ed43ab4c008acc8355c28","observation_id":"75506738-098f-4cc5-9006-a381ef6e2830","resolution":{"observed_at":"2026-05-17T23:25:29.637249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":"d0fc76de-0e45-483d-9621-0b41cd91c6b3","year":2020},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:afd0af80ede75921fb4c31b803b4e3771d73ec3c5fce2bac93e8e83873f36e02","observation_id":"63baa1e1-b5ec-4784-bcf4-0d1ab3d8bb23","resolution":{"observed_at":"2026-05-17T23:25:29.673027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"d99b90a9-70e0-4378-b922-94e7d5e548de","year":2024},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:38e7e813381ca48fa161c9cbf3668c2441bcd785dd65b32d7ae0ecb834777d57","observation_id":"0cac81a4-60f5-43ca-ada6-a04a7df1ce1a","resolution":{"observed_at":"2026-05-17T23:25:29.651748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:bbcbe37e8e733ce660d49ea30d3e6bd595bd60e990f49ba294d9905a21766c03","observation_id":"5a86a0d0-18d2-4bec-9c6e-3b84c97c2383","resolution":{"observed_at":"2026-05-11T10:26:01.950624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:35:55.117252Z","title":"Image quality assessment: from error visibility to structural similarity.IEEE transactions on image processing, 13(4):600–612","venue":null,"work_id":"3a3e908a-1048-4431-9e63-9877936644a4","year":2004},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:23ac343a34000768c4e4091c9974b1b49331bea4d5cbd20b83a330c10f325e8c","observation_id":"47cbdb7e-ffd7-4a73-95e5-b9f1ac60d283","resolution":{"observed_at":"2026-05-17T23:25:29.626496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.05255","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T15:09:54.903577Z","title":"Open vision reasoner: Transferring linguistic cognitive behavior for visual reasoning","venue":null,"work_id":"133cbd5e-1179-4fe7-ad47-1c75d513d025","year":2025},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:18bdb1bf056e357ca1a180eaebe44b5f9b050afe6a51c3dd280eff6d4c06250b","observation_id":"edd76505-38a9-4b5d-8cb5-af12a9118c6f","resolution":{"observed_at":"2026-05-11T10:26:01.944505Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":"fb808fa0-2781-4f0a-b210-799f91e9606e","year":2024},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:dbc3558909cc28f28a81df59be2bc1a65ee8a43811bc61bad27b14e0e56cde43","observation_id":"cd8cd4ee-0ba8-46f9-be89-3e322b5230d6","resolution":{"observed_at":"2026-05-17T23:25:29.661430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:18e38a91d48515dd21c49d8706da1fa761cadc0d3c03c60941052143c6fe1237","observation_id":"4c6ad6c9-fdf3-43df-8778-46a1964bd261","resolution":{"observed_at":"2026-05-11T10:26:01.935651Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17425","last_updated":"2025-02-24T18:56:12Z","snapshot_observed_at":"2026-08-06T00:17:24.145369Z","submitted_at":"2025-02-24T18:56:12Z","title":"Introducing Visual Perception Token into Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":"2502.17425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.17425","snapshot_observed_at":"2026-07-10T07:36:57.997924Z","title":"Introducing visual perception token into multimodal large language model","venue":"cs.CV","work_id":"e6d202f1-5b0b-4af8-8490-511c7c189b9c","year":2025},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"cited_paper":"/paper/2502.17425","citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:48381841dd44eed793922b9549f970666a94bdc68cedb6f31c920ed20a7bcc33","observation_id":"ad7551bf-0755-407d-bbea-79925e110763","resolution":{"observed_at":"2026-05-11T10:26:01.904902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00598","last_updated":"2022-05-27T17:52:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-01T17:43:13Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","version":2},"cited_work":{"arxiv_id":"2204.00598","doi":"10.48550/arxiv.2204.00598","metadata_source":"pith","pith_arxiv_id":"2204.00598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","venue":"cs.CV","work_id":"6c2a6dd5-9b0f-4d86-a291-b605ebdfde6c","year":2022},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"cited_paper":"/paper/2204.00598","citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:c61bd3f9106be7f5c617708ad22d45541605bfec9ccf9046c40affbf0c558e1a","observation_id":"4a740743-3438-4ae6-9ad0-ab9a1b75d28e","resolution":{"observed_at":"2026-05-16T09:50:01.041344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00748","last_updated":"2026-04-12T11:20:16Z","snapshot_observed_at":"2026-07-31T10:24:51.553367Z","submitted_at":"2025-07-01T13:48:57Z","title":"Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2507.00748","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.00748","snapshot_observed_at":"2026-07-04T15:09:55.310131Z","title":"Improving the Reasoning of Multi-Image Grounding in MLLMs via Reinforcement Learning","venue":"cs.CV","work_id":"8af62224-00a2-4ec9-ac50-68f8fb4f77fc","year":2025},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"cited_paper":"/paper/2507.00748","citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:28afd63e34a5e33e4d4eb471a2d0f4bdf4d464775c7bd9e8dbb905bf722c2f29","observation_id":"65ead13e-0d5c-4b26-bcff-61e6f648efcc","resolution":{"observed_at":"2026-05-11T10:26:01.917789Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11630","last_updated":"2025-08-15T17:59:49Z","snapshot_observed_at":"2026-08-03T04:02:35.392835Z","submitted_at":"2025-08-15T17:59:49Z","title":"Thyme: Think Beyond Images","version":1},"cited_work":{"arxiv_id":"2508.11630","doi":"10.48550/arxiv.2508.11630","metadata_source":"pith","pith_arxiv_id":"2508.11630","snapshot_observed_at":"2026-07-11T03:17:52.050556Z","title":"Thyme: Think Beyond Images","venue":"cs.CV","work_id":"f91f31cb-6ce5-43a8-b71e-9fc90a2b4160","year":2025},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"cited_paper":"/paper/2508.11630","citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:5f0d335ce01bf4404ef098e27bcb375d351022f45cce08985ef67a9ad177d31c","observation_id":"e796cd22-198b-4d2f-bedd-16dcb0c9a8a4","resolution":{"observed_at":"2026-05-15T00:33:29.495992Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.16400","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T15:09:55.294552Z","title":"Vipact: Visual-perception enhancement via specialized vlm agent collaboration and tool-use","venue":null,"work_id":"e314f0b9-a27e-4697-9ad1-8bc6454b39a2","year":2024},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:2d0c50de48ac04f3488d94258270aee1d1ef76368d8647f48ed4cfaafc92ef8f","observation_id":"9d74e71e-3af3-426f-a6cd-fa668f1aaefb","resolution":{"observed_at":"2026-05-11T10:26:01.958968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01656","last_updated":"2025-09-01T17:57:49Z","snapshot_observed_at":"2026-08-06T02:38:32.042356Z","submitted_at":"2025-09-01T17:57:49Z","title":"Reinforced Visual Perception with Tools","version":1},"cited_work":{"arxiv_id":"2509.01656","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.01656","snapshot_observed_at":"2026-07-10T07:36:57.995051Z","title":"Reinforced visual perception with tools","venue":"cs.CV","work_id":"4b06b3fa-508d-4153-ae9a-da6c80291228","year":2025},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"cited_paper":"/paper/2509.01656","citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:78caf2c8d300d401a6f6bb8df4e034f7f2eee422ba00c4c744f451fbab7c0dbc","observation_id":"7c0852ea-11b5-4a98-be9c-18e7298cf73c","resolution":{"observed_at":"2026-05-11T10:26:01.924607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mainly, we provide samples of prompts for both frontier and open-source MLLMs","venue":null,"work_id":"dc7ab422-ed1e-4c0a-bd6f-3e64abecb85e","year":null},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:b84d7cfc9730f5046c5636fac99bb7923e5ee0e00b66f1d17af75566014e78b6","observation_id":"827ec209-92dc-4c38-ae08-0b7fdcfc99bd","resolution":{"observed_at":"2026-05-17T23:25:29.640749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"left\" or","venue":null,"work_id":"455bb62f-2af9-4345-b7e3-a3c9b348de82","year":null},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:9339b7d25095be9120f228b9909f4c0cad18d0a60646d137b2cba03c382c5cbe","observation_id":"d0ea9244-4b20-4433-b8aa-5651e641f6c2","resolution":{"observed_at":"2026-05-17T23:25:29.644241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"5.1 we discussed the quality of visual interpretation of current MLLMs","venue":null,"work_id":"15180d57-23cc-44fe-a575-d9dd08f6a6f2","year":null},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:7c6840b6d1a2b5539517f9242c52c5d914d76b9234e771ac4fd23421fe65f2e2","observation_id":"d94cf8ab-521a-4cb9-8777-7e17d42d456e","resolution":{"observed_at":"2026-05-17T23:25:29.676071Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"125074c8-194f-4613-a4c1-f346e121b00c","year":null},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:d89f64f0b642431b688870fa3e9bd699f2cfc7cf7c9d46c08e5f5503d3cf22e2","observation_id":"89665866-e434-43de-820b-3ef85228df5b","resolution":{"observed_at":"2026-05-17T23:25:29.664380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T17:57:48.307510Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":15,"verified_fuzzy":22},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2604.12896."}