{"as_of":"2026-08-17T15:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:42cf19e8cfd9681c797960ce343a602eaa8f9fa2f3ee280783fa2eded6dd405c","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:08:18.584497Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:45:30.706182Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T06:18:05.238771Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18072","snapshot_observed_at":"2026-08-07T05:45:30.706182Z","title":"Mmfactory: A universal solution search engine for vision-language tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07235","last_updated":"2025-06-08T17:38:49Z","snapshot_observed_at":"2026-08-17T02:00:49.267055Z","submitted_at":"2025-06-08T17:38:49Z","title":"Multi-Step Visual Reasoning with Visual Tokens Scaling and Verification","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:45:30.706182Z"},"links":{"cited_paper":"/paper/2412.18072","citing_paper":"/paper/2506.07235"},"observation_digest":"sha256:585d47fc8c21bd965617d7a066fc503ff0c430617f77bd3ce08dd74662df0793","observation_id":"65f1e13d-11f2-4578-9337-f6ffec9cf394","resolution":{"observed_at":"2026-08-07T05:45:30.706182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"cited_work":{"arxiv_id":"2412.18072","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18072","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2412.18072 , year=","venue":null,"work_id":"2f5b3555-f99f-49e0-b3d4-a0cf317d2df0","year":2024},"citing_paper":{"arxiv_id":"2604.12896","last_updated":"2026-04-14T15:45:22Z","snapshot_observed_at":"2026-08-14T18:20:32.782574Z","submitted_at":"2026-04-14T15:45:22Z","title":"Don't Show Pixels, Show Cues: Unlocking Visual Tool Reasoning in Language Models via Perception Programs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:25.650175Z"},"links":{"cited_paper":"/paper/2412.18072","citing_paper":"/paper/2604.12896"},"observation_digest":"sha256:d8b296c4188e386a4d6f31961295e749366837fe2c1193048063e84a006fc2d1","observation_id":"bdb2de89-3591-442e-b628-56222da10caf","resolution":{"observed_at":"2026-05-11T10:26:01.993879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"cited_work":{"arxiv_id":"2412.18072","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.18072","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2412.18072 , year=","venue":null,"work_id":"2f5b3555-f99f-49e0-b3d4-a0cf317d2df0","year":2024},"citing_paper":{"arxiv_id":"2605.19852","last_updated":"2026-06-03T11:11:28Z","snapshot_observed_at":"2026-08-13T09:24:20.626075Z","submitted_at":"2026-05-19T13:44:26Z","title":"Are Tools Always Beneficial? Learning to Invoke Tools Adaptively for Dual-Mode Multimodal LLM Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-20T06:16:47.650748Z"},"links":{"cited_paper":"/paper/2412.18072","citing_paper":"/paper/2605.19852"},"observation_digest":"sha256:f972cf1134e965c0fe4f6c1ae1ffeb99f8f771d4ff482821f0579a23ff66d5a4","observation_id":"aca3ad99-8983-48d1-a0bb-daaead6f19e8","resolution":{"observed_at":"2026-05-20T06:18:05.240829Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.18072/citation-record","integrity":"/paper/2412.18072/integrity","json":"/paper/2412.18072/citation-record.json","paper":"/paper/2412.18072"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-11T05:08:17.394176Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.394176Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:1073659c2f4765341a2472ea3ba1541d322481d08625c05fcd338132901f5420","observation_id":"a4f5c203-505b-4adf-86d3-ef65d151a14e","resolution":{"observed_at":"2026-08-11T05:08:17.394176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T05:08:17.406018Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.406018Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:a97fcbba8753bdddb9fde2105edcca8d6a0633ea0080b0f9768fe8774f21e3a7","observation_id":"3b318b47-206f-4f58-9da8-bfa1303795da","resolution":{"observed_at":"2026-08-11T05:08:17.406018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:23.290936Z","title":"Neural module networks","venue":null,"work_id":"9809d16d-a629-4d34-81bd-d831fa021deb","year":2016},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.426167Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:0fd6b0ac298e99ce33f393292b5a9847faf4d7e41606b78d569088a55fedede2","observation_id":"983816f5-d423-4c23-a836-b1c20b6bbf90","resolution":{"observed_at":"2026-08-11T05:08:23.359929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:23.162800Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"61ebc4e1-da06-479b-998f-a728baa4ee3e","year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.445014Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:76d71e6fb7ce6a5408a0e944578ae10783bde0a3263ada78d07893f1ba9612b2","observation_id":"46b88a55-f9e9-4309-9617-c536a7a0e4ec","resolution":{"observed_at":"2026-08-11T05:08:23.229639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-11T05:08:17.461636Z","title":"Openflamingo: An open- source framework for training large autoregressive vision- language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.461636Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:8fcb0152e0624e165b677ecc0aa8481eca5c03492b8426846930f3ca3c9cf37e","observation_id":"741337ec-35d3-486e-933f-4712d0f8c705","resolution":{"observed_at":"2026-08-11T05:08:17.461636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10631","last_updated":"2024-03-15T19:14:39Z","snapshot_observed_at":"2026-08-16T13:51:18.629241Z","submitted_at":"2023-10-16T17:54:07Z","title":"Llemma: An Open Language Model For Mathematics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10631","snapshot_observed_at":"2026-08-11T05:08:17.500113Z","title":"Llemma: An open language model for mathematics","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.500113Z"},"links":{"cited_paper":"/paper/2310.10631","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:9887b9f912a9355eff13365b9950dc1256c4078039b1ab79a56779e9a9f873e4","observation_id":"ae1473ba-30fd-4330-b683-06fac6c405a9","resolution":{"observed_at":"2026-08-11T05:08:17.500113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T05:08:17.513467Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.513467Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:dbc8ab121776860df5b91b9cb2e4715ba74d1d2f8cb4ff8d60a4d2d9ac0e5a68","observation_id":"9901233e-77a0-4cb9-98f1-4fff56020835","resolution":{"observed_at":"2026-08-11T05:08:17.513467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:23.101536Z","title":"2alliance.can.ca 3https://vectorinstitute.ai/#partners Audiolm: a language modeling approach to audio genera- tion","venue":null,"work_id":"681f4b14-2b2c-45db-8466-03b0b38a18c9","year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.526591Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:637923508015500e6504016b3f7f663e155f556d9d60a78527df0fc466b2dc19","observation_id":"c6314d73-c738-4fc7-9268-03b3a93244db","resolution":{"observed_at":"2026-08-11T05:08:23.133920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T05:08:17.537399Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.537399Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:0ebe66d34bb07c7451554cc6270cafbce01be83f516cb5be48bf281bad1d93bf","observation_id":"1d4422b2-3183-4872-b068-6c6730d3f162","resolution":{"observed_at":"2026-08-11T05:08:17.537399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:22.982156Z","title":"LangChain, 2022","venue":null,"work_id":"f5f9d6b3-a703-4898-b5b5-f7ef4fd356a0","year":2022},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.551693Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:946c5ac43b5466b7bc0447bc60bcaa5f5035104f2a6195570f7ed3d9bd0bd35c","observation_id":"73ff7ef2-95d8-4f8a-9d90-585a70a3902a","resolution":{"observed_at":"2026-08-11T05:08:23.040723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:22.860704Z","title":"Spatialvlm: Endow- ing vision-language models with spatial reasoning capabili- ties","venue":null,"work_id":"baee22c3-e31d-4c93-a554-5a24b7a904dc","year":2024},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.570667Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:02bf0dc1744770f260f6b3c27b27748e18f9f88c07e34cdc5dba7896533c1f27","observation_id":"1653d4f0-79b3-476c-a6db-990c766c1b28","resolution":{"observed_at":"2026-08-11T05:08:22.929265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17288","last_updated":"2024-04-29T18:38:26Z","snapshot_observed_at":"2026-08-16T14:56:29.843666Z","submitted_at":"2023-09-29T14:46:30Z","title":"AutoAgents: A Framework for Automatic Agent Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17288","snapshot_observed_at":"2026-08-11T05:08:17.587888Z","title":"Autoagents: A framework for automatic agent generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.587888Z"},"links":{"cited_paper":"/paper/2309.17288","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:46d8899569b830b06878a4c49de6824166373fd4d96992b52240c55a0227b495","observation_id":"39b13b4b-46d1-4227-8a77-cd16fb3cf9a5","resolution":{"observed_at":"2026-08-11T05:08:17.587888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-16T15:30:58.546906Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-11T05:08:17.601318Z","title":"Videollm: Modeling video sequence with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.601318Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:ee017ec0afc1eba7fb0926df751ad57d10c0c5689a73be796bed02ecb3342e45","observation_id":"1683ec43-3ce3-4db5-b21f-6205477ce7fa","resolution":{"observed_at":"2026-08-11T05:08:17.601318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:22.749121Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning","venue":null,"work_id":"e2c9e8e1-de2f-4cc6-9f04-fa258a06253d","year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.607869Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:7e71e1c810163e43534d4751a11ce86169729bb52b098fd86dec0429ff3a4090","observation_id":"84e4fc5e-da9d-4de1-be9a-835ed6f73b47","resolution":{"observed_at":"2026-08-11T05:08:22.821793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08295","last_updated":"2025-03-24T21:06:53Z","snapshot_observed_at":"2026-08-16T13:52:57.510888Z","submitted_at":"2024-05-14T03:33:31Z","title":"SpeechVerse: A Large-scale Generalizable Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08295","snapshot_observed_at":"2026-08-11T05:08:17.616757Z","title":"Speech- verse: A large-scale generalizable audio language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.616757Z"},"links":{"cited_paper":"/paper/2405.08295","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:3df1845b9f9890fbefd6f5e417872f14d144f7fa86c7d4663063b8f0a7ad0235","observation_id":"4354f0ba-dcae-4d10-b5ba-6989fe90e10c","resolution":{"observed_at":"2026-08-11T05:08:17.616757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14325","last_updated":"2023-05-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:55:11Z","title":"Improving Factuality and Reasoning in Language Models through Multiagent Debate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14325","snapshot_observed_at":"2026-08-11T05:08:17.636551Z","title":"Improving factuality and reason- ing in language models through multiagent debate","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.636551Z"},"links":{"cited_paper":"/paper/2305.14325","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:d65c7ba8556134139cc1eb1b58f4d4917fcfc9ca55c85a828b4082fec6e0fd09","observation_id":"9a2b05dd-a6b8-439e-b9e7-480947e1954d","resolution":{"observed_at":"2026-08-11T05:08:17.636551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14506","last_updated":"2025-07-17T18:53:04Z","snapshot_observed_at":"2026-08-16T13:32:38.056236Z","submitted_at":"2024-07-19T17:58:36Z","title":"On Pre-training of Multimodal Language Models Customized for Chart Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14506","snapshot_observed_at":"2026-08-11T05:08:17.655767Z","title":"On pre-training of multimodal language models customized for chart understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.655767Z"},"links":{"cited_paper":"/paper/2407.14506","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:ec04684ca051fe2b5a713317d1b8889af692650edde51bac6e88867aa2fc0d76","observation_id":"694a3193-f3c9-4de7-8b6a-d6adce4e5629","resolution":{"observed_at":"2026-08-11T05:08:17.655767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:22.597948Z","title":"Prompting large language models with speech recognition abilities","venue":null,"work_id":"de88ec4a-71fd-437f-bd33-6eb165efa370","year":2024},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.684755Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:41ba71112c788480f9065542a6e542cfa7f3a556633d7d70ea1aed126b42699e","observation_id":"7b0ba662-d6c9-454e-b73b-af78bec497c8","resolution":{"observed_at":"2026-08-11T05:08:22.662945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-14T00:50:08.075021Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-11T05:08:17.696188Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.696188Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:65d0349dcf55666e4d7034abede679b61cbacc41c96e1f5b732516564d0e56dc","observation_id":"2ca317ef-07e8-4b03-8e4d-b73c4f167674","resolution":{"observed_at":"2026-08-11T05:08:17.696188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:22.461034Z","title":"Gemini: A family of highly capa- ble multimodal models","venue":null,"work_id":"400e7477-cc98-4bcc-988a-50acfafdd9d6","year":null},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.725188Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:db285c6955c0f6a545752c18a4b17c4464cfa7492edd1dcfe33abb4258a26b9e","observation_id":"2290030f-6860-494e-ace9-15218e44e013","resolution":{"observed_at":"2026-08-11T05:08:22.525190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:22.340965Z","title":"Github copilot, 2023","venue":null,"work_id":"d029817f-0e9e-423b-b1de-31dafec956e8","year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.740931Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:fed8efde87e10b31bb63c0300c0e3d4695de627c84e644a366b7d603dd6ae69a","observation_id":"eb3ab64d-216d-492d-ad3a-80e99f56e846","resolution":{"observed_at":"2026-08-11T05:08:22.416960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:22.244869Z","title":"Visual program- ming: Compositional visual reasoning without training","venue":null,"work_id":"83de9314-1a01-4ab0-b91c-c131ada771ff","year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.750684Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:c473c30264620f9040a25ec40783ea1377bcfe171e216e22787c2b975f33c166","observation_id":"470c86f8-f90f-44db-8af1-1a935bf09af8","resolution":{"observed_at":"2026-08-11T05:08:22.309323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16483","last_updated":"2023-11-27T15:20:23Z","snapshot_observed_at":"2026-08-16T14:40:01.654059Z","submitted_at":"2023-11-27T15:20:23Z","title":"ChartLlama: A Multimodal LLM for Chart Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16483","snapshot_observed_at":"2026-08-11T05:08:17.760283Z","title":"Chartllama: A mul- 9 timodal llm for chart understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.760283Z"},"links":{"cited_paper":"/paper/2311.16483","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:217ed3bedec14d5ac7fbb2c05a442cc367631550c05e69f95c802e120e17f6b7","observation_id":"72b8b917-731e-4c93-9e43-96cebd46389d","resolution":{"observed_at":"2026-08-11T05:08:17.760283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:17.770816Z","title":"3d-llm: Inject- ing the 3d world into large language models.NeurIPS, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.770816Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:6dc902f7670e844ae2cf78a54c38ca33321ef629a6e996a2bad0d0474dc494b8","observation_id":"d2d58e38-d08a-4155-b724-ec49581487d9","resolution":{"observed_at":"2026-08-11T05:08:17.770816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12031","last_updated":"2024-03-28T17:56:28Z","snapshot_observed_at":"2026-08-16T16:38:21.205977Z","submitted_at":"2024-03-18T17:59:04Z","title":"RouterBench: A Benchmark for Multi-LLM Routing System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12031","snapshot_observed_at":"2026-08-11T05:08:17.783683Z","title":"Routerbench: A bench- mark for multi-llm routing system","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.783683Z"},"links":{"cited_paper":"/paper/2403.12031","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:e777091b26d3f591223bc5b0ddea71ed9a0acb368f1a1a624d42f1c37b52ac6e","observation_id":"d5f746e9-d8cc-4d06-b043-514f3c6ceeee","resolution":{"observed_at":"2026-08-11T05:08:17.783683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-16T13:43:12.869356Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-11T05:08:17.796765Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.796765Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:77f6098d7c172b2c575d72a97d2615962c9fa8b45135d5d0fddf1a7a0ee31bdf","observation_id":"ab77d179-93ad-4ada-936e-661e39d0a07a","resolution":{"observed_at":"2026-08-11T05:08:17.796765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T02:13:39.510069Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T05:08:17.804106Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.804106Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:18622f103420f010a9840cf34c0ab481fe337655bdd3c5a58040a0d9e48330fc","observation_id":"e8c4865e-0b23-414e-a94b-53f6fb404155","resolution":{"observed_at":"2026-08-11T05:08:17.804106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:22.096117Z","title":"Inferring and executing programs for visual reasoning","venue":null,"work_id":"dff25818-b212-417f-a0c2-4424694738b5","year":2017},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.811583Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:7b9b88aac77c34706ce2ccca0ec04429cf675728b1835e1e24b3ae1014013590","observation_id":"2cfb9508-9058-4a28-9f9b-de80d680624c","resolution":{"observed_at":"2026-08-11T05:08:22.121119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10062","last_updated":"2024-03-23T03:50:18Z","snapshot_observed_at":"2026-08-16T14:59:41.217277Z","submitted_at":"2023-09-18T18:17:56Z","title":"SMART-LLM: Smart Multi-Agent Robot Task Planning using Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10062","snapshot_observed_at":"2026-08-11T05:08:17.819774Z","title":"Smart-llm: Smart multi-agent robot task planning using large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.819774Z"},"links":{"cited_paper":"/paper/2309.10062","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:26e6ff0193d5dedff96f20bd1398d98d909e74ebc14d2c58f0f660d82b49e900","observation_id":"02053326-1dca-4782-a625-180f14b7b47e","resolution":{"observed_at":"2026-08-11T05:08:17.819774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:17.830533Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.830533Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:46f2304b4f2f4d6b35064b6c06c975167c47da1e5852f9647c33b84093eb5eb2","observation_id":"10fda0a9-54f0-4947-b21e-2bf3ea596137","resolution":{"observed_at":"2026-08-11T05:08:17.830533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:21.906374Z","title":"Seed-bench: Bench- marking multimodal large language models","venue":null,"work_id":"bfc2c4c2-0d6f-44ee-822d-1c3e1c83ee8c","year":2024},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.839948Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:f159778b464f18e1b7a70384d963d5fbcef9924539ff1bf477ca975cb4e570e9","observation_id":"06aa363c-0278-4f65-bda5-6950f65bb378","resolution":{"observed_at":"2026-08-11T05:08:21.975705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:21.797476Z","title":"Camel: Communicative agents for” mind” exploration of large language model society.NeurIPS,","venue":null,"work_id":"ec733c91-42ad-4bdf-ac5c-64a6e1471ca3","year":null},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.866599Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:0f19ee5fcd4e1963283a4a7c56fe78ad57cebf179fc8d5efa1a214228cfa6ddd","observation_id":"93372e29-1cdd-4f3d-a3e9-de4806047786","resolution":{"observed_at":"2026-08-11T05:08:21.850513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19118","last_updated":"2024-10-09T02:41:21Z","snapshot_observed_at":"2026-08-15T13:46:19.286791Z","submitted_at":"2023-05-30T15:25:45Z","title":"Encouraging Divergent Thinking in Large Language Models through Multi-Agent Debate","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19118","snapshot_observed_at":"2026-08-11T05:08:17.884025Z","title":"Encouraging divergent thinking in large lan- guage models through multi-agent debate","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.884025Z"},"links":{"cited_paper":"/paper/2305.19118","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:a3142fae098443b63d7fe43214eec281f1b671b5e158fee5b80e2715a8bc2792","observation_id":"79c5602a-17c9-4f2a-972e-d0eb14d98e8e","resolution":{"observed_at":"2026-08-11T05:08:17.884025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:17.902000Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.902000Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:0cadfde4093b44122d4c99b8bbb60d4e5859231c87028da7703fce191ca72c6b","observation_id":"3861a152-e9e6-4d92-801c-b202b2f7b1e9","resolution":{"observed_at":"2026-08-11T05:08:17.902000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05437","last_updated":"2023-11-09T15:22:26Z","snapshot_observed_at":"2026-08-17T09:14:08.623745Z","submitted_at":"2023-11-09T15:22:26Z","title":"LLaVA-Plus: Learning to Use Tools for Creating Multimodal Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05437","snapshot_observed_at":"2026-08-11T05:08:17.917244Z","title":"Llava-plus: Learning to use tools for creating multi- modal agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.917244Z"},"links":{"cited_paper":"/paper/2311.05437","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:9a98cdeef08226de099691f9db3855225ae448d9d386a4460f7f3393e90a1642","observation_id":"7df78bfc-b529-4460-93eb-e96e6e96808b","resolution":{"observed_at":"2026-08-11T05:08:17.917244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-11T05:08:17.930205Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.930205Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:4c7cad1a96da4e051122d556c98fd3fe2190334d07a570ad8af361c38ff1ee79","observation_id":"8ca390be-8b4c-4ca6-93c2-04e10f0829f2","resolution":{"observed_at":"2026-08-11T05:08:17.930205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-11T05:08:17.951793Z","title":"Deepseek-vl: towards real-world vision- language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.951793Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:992543359cf137f03a10861ce5d1c6828dc025650319838624c39ca498c163b0","observation_id":"6cf7d2ef-a455-4244-ab19-7d8db1c1706f","resolution":{"observed_at":"2026-08-11T05:08:17.951793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:21.652097Z","title":"Chameleon: Plug-and-play compositional reasoning with large language models","venue":null,"work_id":"8ddd97e5-bdf0-4b91-9246-62ec49c4ba55","year":2024},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.969022Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:ce67fab766b9abe12d8ffedf10f16c696f998477e0b4e26fd576523e52292150","observation_id":"20ef57df-5b18-4d88-8bfb-3bb1cddc2930","resolution":{"observed_at":"2026-08-11T05:08:21.710940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-08-16T18:14:04.403890Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-11T05:08:17.980106Z","title":"Mm1: Methods, analysis & insights from multimodal llm pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.980106Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:f73f7c27996a32d54023df2fe64e79b900806dd138a9dd79513441bfd70721e8","observation_id":"3a333811-22ab-4f53-89ea-13bb47220807","resolution":{"observed_at":"2026-08-11T05:08:17.980106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02384","last_updated":"2024-02-15T15:34:51Z","snapshot_observed_at":"2026-08-16T14:29:47.699314Z","submitted_at":"2024-01-04T17:51:48Z","title":"ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02384","snapshot_observed_at":"2026-08-11T05:08:17.988137Z","title":"Chartassisstant: A universal chart multimodal language model via chart-to-table pre-training and multitask instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:17.988137Z"},"links":{"cited_paper":"/paper/2401.02384","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:fb8f579aa4e123292476aa913f50bb1d3247ae9995e7bc66baabb3d9009c7e64","observation_id":"693dc120-eef1-4532-aa0a-d1a7aa08b944","resolution":{"observed_at":"2026-08-11T05:08:17.988137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18665","last_updated":"2025-02-23T08:50:33Z","snapshot_observed_at":"2026-08-16T00:08:23.767909Z","submitted_at":"2024-06-26T18:10:22Z","title":"RouteLLM: Learning to Route LLMs with Preference Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18665","snapshot_observed_at":"2026-08-11T05:08:18.006616Z","title":"Routellm: Learning to route llms with preference data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.006616Z"},"links":{"cited_paper":"/paper/2406.18665","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:be6501db747c8ea423173f4bc907926cc9f4653715f368ad3b8c8530d4e3a975","observation_id":"c3879649-0653-42c3-bac8-a076c6f618c0","resolution":{"observed_at":"2026-08-11T05:08:18.006616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:21.610878Z","title":"Gpt-4 technical report","venue":null,"work_id":"2c87d597-0ed6-4b36-a5d0-735a61b37d87","year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.017384Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:834c69c67253d0c9564d66fa96406c92f4d6c65e5ee34b34ec289478a51caf09","observation_id":"97aeac83-7af6-4871-b09e-3498bb6ee1b3","resolution":{"observed_at":"2026-08-11T05:08:21.619164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08560","last_updated":"2024-02-12T18:59:46Z","snapshot_observed_at":"2026-08-15T11:39:49.280087Z","submitted_at":"2023-10-12T17:51:32Z","title":"MemGPT: Towards LLMs as Operating Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08560","snapshot_observed_at":"2026-08-11T05:08:18.038234Z","title":"Memgpt: Towards llms as operating systems","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.038234Z"},"links":{"cited_paper":"/paper/2310.08560","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:38cc06dc70c420e0cf40e5dd4fa1e3cec118eb42776fab4ae7a2818c86ae1f65","observation_id":"31f2458a-182c-46eb-8fe9-462d45e532d2","resolution":{"observed_at":"2026-08-11T05:08:18.038234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15334","last_updated":"2023-05-24T16:48:11Z","snapshot_observed_at":"2026-08-14T14:07:14.900729Z","submitted_at":"2023-05-24T16:48:11Z","title":"Gorilla: Large Language Model Connected with Massive APIs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15334","snapshot_observed_at":"2026-08-11T05:08:18.054754Z","title":"Gorilla: Large language model connected with massive apis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.054754Z"},"links":{"cited_paper":"/paper/2305.15334","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:416598a4c6606aa340ad3030026568f8a6eb9a64b5d00629c85160e14fe60b75","observation_id":"3fcfff60-fc26-4211-a69b-0171121a890c","resolution":{"observed_at":"2026-08-11T05:08:18.054754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16789","last_updated":"2023-10-03T14:45:48Z","snapshot_observed_at":"2026-08-16T04:18:30.717622Z","submitted_at":"2023-07-31T15:56:53Z","title":"ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16789","snapshot_observed_at":"2026-08-11T05:08:18.086382Z","title":"Toolllm: Facilitating large language models to master 16000+ real-world apis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.086382Z"},"links":{"cited_paper":"/paper/2307.16789","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:110fdd9a95a48e8e21a77fd500a8a6b9fd6985e89168e624c4ad7955cab47ac1","observation_id":"56f005bd-6462-4336-a141-80b99726f7ee","resolution":{"observed_at":"2026-08-11T05:08:18.086382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-13T04:25:38.282910Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-11T05:08:18.126322Z","title":"Code llama: Open foun- dation models for code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.126322Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:a9191f75d95671a03f242b952b7f9a8f27fac0a2067ed117d2a77ecb7f4bd382","observation_id":"09af07d0-b562-411e-b31e-828dd68f7bba","resolution":{"observed_at":"2026-08-11T05:08:18.126322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15789","last_updated":"2023-09-27T17:08:40Z","snapshot_observed_at":"2026-08-16T14:57:08.067521Z","submitted_at":"2023-09-27T17:08:40Z","title":"Large Language Model Routing with Benchmark Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15789","snapshot_observed_at":"2026-08-11T05:08:18.164866Z","title":"Large language model routing with benchmark datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.164866Z"},"links":{"cited_paper":"/paper/2309.15789","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:3f735e9cf902b59a132d15a44dae0eb5588c26875c20df19dcdd41ac7cbb4466","observation_id":"41a29bdf-f416-48bc-a48b-88829c5bac19","resolution":{"observed_at":"2026-08-11T05:08:18.164866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:21.455081Z","title":null,"venue":null,"work_id":"8ee2259d-35a1-446c-88d9-6247c5f287a0","year":null},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.229947Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:ca7f05a74ce5aa891f57a15d5fa2bee65d6a04e751e4b578471663130e772391","observation_id":"bd10d932-041e-482a-b737-b58e1e3dedd3","resolution":{"observed_at":"2026-08-11T05:08:21.524758Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:18.252543Z","title":"Vipergpt: Vi- sual inference via python execution for reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.252543Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:62e5e0345c17c2e2c2edef90a784274cd9a1f4c06d502dbe49e245076bc004e5","observation_id":"721c3e8d-9974-4bcb-be31-ad77f223771e","resolution":{"observed_at":"2026-08-11T05:08:18.252543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10537","last_updated":"2024-06-04T23:47:43Z","snapshot_observed_at":"2026-08-16T14:42:42.887676Z","submitted_at":"2023-11-16T11:47:58Z","title":"MedAgents: Large Language Models as Collaborators for Zero-shot Medical Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10537","snapshot_observed_at":"2026-08-11T05:08:18.277962Z","title":"Meda- gents: Large language models as collaborators for zero-shot medical reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.277962Z"},"links":{"cited_paper":"/paper/2311.10537","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:55b9ea55f136d01a1c86239c24c21f5b9366faa4f79881bcfb7756bb03732bb2","observation_id":"c589246c-7b61-4f76-bd10-94960fad4699","resolution":{"observed_at":"2026-08-11T05:08:18.277962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T05:08:18.293949Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.293949Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:fef01bcebcf92303de1b08f710b54ffb442a581c541d1edfca9f6325672acdaf","observation_id":"8ca9ce45-b44f-4cd6-800b-73ecbde2cd71","resolution":{"observed_at":"2026-08-11T05:08:18.293949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-11T05:08:18.304021Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.304021Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:43b67d5635729125b37b482edfaa59b433dd2a826ddc85384618c0847f30169d","observation_id":"51868703-5eff-4c5a-8fdf-2ae50fe43276","resolution":{"observed_at":"2026-08-11T05:08:18.304021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T05:08:18.328620Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.328620Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:31acd448bb02c748c99daed03696d15bd8ec182b05bd3c738d53de75756f9fa1","observation_id":"5e3aec71-3350-437c-9779-871d176a9006","resolution":{"observed_at":"2026-08-11T05:08:18.328620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03731","last_updated":"2023-10-05T17:52:09Z","snapshot_observed_at":"2026-08-16T14:54:42.760719Z","submitted_at":"2023-10-05T17:52:09Z","title":"MathCoder: Seamless Code Integration in LLMs for Enhanced Mathematical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03731","snapshot_observed_at":"2026-08-11T05:08:18.358243Z","title":"Mathcoder: Seamless code integration in llms for enhanced mathematical reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.358243Z"},"links":{"cited_paper":"/paper/2310.03731","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:7b0a4420712e11ae0034cae29d2c5e936284b8cda95aeda34a2a7cc07feffd0f","observation_id":"6340e983-61dd-4935-a9ba-3e7add5a23cc","resolution":{"observed_at":"2026-08-11T05:08:18.358243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T05:08:18.392280Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.392280Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:3afdc26e640d2bb9bd69e4ac852d82461a8b257f9be5a32c476650df2f47e7e3","observation_id":"252471fb-a11c-4262-80f7-2a748906c09d","resolution":{"observed_at":"2026-08-11T05:08:18.392280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08155","last_updated":"2023-10-03T20:47:10Z","snapshot_observed_at":"2026-08-08T22:28:26.004138Z","submitted_at":"2023-08-16T05:57:52Z","title":"AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08155","snapshot_observed_at":"2026-08-11T05:08:18.424752Z","title":"Autogen: Enabling next-gen llm ap- plications via multi-agent conversation framework","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.424752Z"},"links":{"cited_paper":"/paper/2308.08155","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:a5c1fcbf53df656a5d259a8053b9f853a125175113ec10dfa93b877b12c0ff9f","observation_id":"21dc3783-ae4b-4acb-8d00-ab75a66c6525","resolution":{"observed_at":"2026-08-11T05:08:18.424752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01337","last_updated":"2024-06-28T10:26:27Z","snapshot_observed_at":"2026-08-16T15:27:13.680821Z","submitted_at":"2023-06-02T08:02:15Z","title":"MathChat: Converse to Tackle Challenging Math Problems with LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01337","snapshot_observed_at":"2026-08-11T05:08:18.474752Z","title":"An empirical study on challeng- ing math problem solving with gpt-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.474752Z"},"links":{"cited_paper":"/paper/2306.01337","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:4e00bb96160e94f60c53258cb161f9128962f862fc80aa144321182bdad8e137","observation_id":"579a8b35-8950-409a-b660-e1ba0d015d43","resolution":{"observed_at":"2026-08-11T05:08:18.474752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-12T21:25:32.312122Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-11T05:08:18.494750Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.494750Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:0b74cf704f88ca13034766fbecec599ad1885192333c14295ff91ce71fe0ffde","observation_id":"54e4ad15-c8db-4373-9fed-1556437a92ab","resolution":{"observed_at":"2026-08-11T05:08:18.494750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:18.504689Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.504689Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:ed0250bfd0d68a095c79bcb84c5d353c93118799693e8a878ac781fa18e327e9","observation_id":"3abb525e-8f75-4ce3-8eb4-5334ad1e6b5f","resolution":{"observed_at":"2026-08-11T05:08:18.504689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:18.519871Z","title":"Large language models for robotics: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.519871Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:0cfbe74ca5fad48e93cc514660d924d2e995bffd0777fc6423201727beddb51d","observation_id":"cffd7636-20ce-4ab6-a704-dd1ee3603890","resolution":{"observed_at":"2026-08-11T05:08:18.519871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-08-13T15:50:38.254753Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-11T05:08:18.534753Z","title":"Video-llama: An instruction-tuned audio-visual language model for video un- derstanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.534753Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:0882f98ec6a63c026176ce5ba7afadbbd8f30055faaae2a44921732bc398ce20","observation_id":"7d87adcf-d70a-48ec-ab58-d0c48e698052","resolution":{"observed_at":"2026-08-11T05:08:18.534753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-08-17T05:14:27.567959Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-08-11T05:08:18.546696Z","title":"Internlm- xcomposer: A vision-language large model for advanced text-image comprehension and composition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.546696Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:de371ba16c4dfe1c1d2d34d5230f6e6c3ba0267f55a964fb077277a9dff688ef","observation_id":"89604d47-2af2-440d-9a69-e8f8291d8436","resolution":{"observed_at":"2026-08-11T05:08:18.546696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T05:08:18.565674Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.565674Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:1019e26e798dcbab6f843241b8496a405ef1834d83eb52dca8819d0e85e185fe","observation_id":"aa4926f1-327b-4e7a-a726-9f4e60d4615c","resolution":{"observed_at":"2026-08-11T05:08:18.565674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:08:21.320266Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":"23aa86ee-de1e-4653-b441-98c473984cde","year":2023},"citing_paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T05:08:18.584497Z"},"links":{"citing_paper":"/paper/2412.18072"},"observation_digest":"sha256:c38e3d97895562e06e28d407c4bf3ac9d3851f7d28488be1b103ccf4e0f06258","observation_id":"f7140698-038f-42a2-aa50-82dc76561d43","resolution":{"observed_at":"2026-08-11T05:08:21.367042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.18072","last_updated":"2024-12-24T00:59:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T02:56:20.537702Z","submitted_at":"2024-12-24T00:59:16Z","title":"MMFactory: A Universal Solution Search Engine for Vision-Language Tasks"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 3 inbound Pith citation observations for arXiv:2412.18072."}