{"as_of":"2026-08-04T22:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:70d43c6fdb75ec907839fc7ece523c9723f0e69398b4f4080c2b185db63fc1f5","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T22:29:29.631351Z","state":"measured"},{"denominator":143,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":143,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":271,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:20:31.884483Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T00:27:51.904332Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-14T01:17:58.678036Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2303.11381"},"observation_digest":"sha256:f390f8e2ebd47788ada5378c47a39d2083fa4b99e7e9c35eeb97763eae12446c","observation_id":"6a8c0286-ff1f-4f13-ae9c-071fae1588f2","resolution":{"observed_at":"2026-05-14T01:17:58.747224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2303.17491","last_updated":"2023-11-16T20:15:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T16:01:52Z","title":"Language Models can Solve Computer Tasks","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T12:17:26.602361Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2303.17491"},"observation_digest":"sha256:b362d40dd9060731088937d49a2f1c544d375294b85e564c0b163424f24c38a7","observation_id":"c1f45a0d-ffc9-4e1d-9d69-a49c7aa7edb0","resolution":{"observed_at":"2026-05-17T12:17:26.720074Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-04T21:26:45.570460Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T22:46:39.268353Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2303.18223"},"observation_digest":"sha256:57f417452d255d92177dc2675af976c0ebb1ff6a3b1b80da949f6b41a8478165","observation_id":"4a3ee7e5-e8bb-49e5-81a3-7dfc0eccc039","resolution":{"observed_at":"2026-05-10T22:46:40.806798Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T08:22:03.403362Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2304.08485"},"observation_digest":"sha256:68ea544534e937832f5cade5628446adede2fc70862eba913d852a59f6822ff9","observation_id":"8b7de1f7-e58e-4c01-af4f-9a3c173f2770","resolution":{"observed_at":"2026-05-11T08:22:03.701283Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T20:37:01.617345Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2304.10592"},"observation_digest":"sha256:d0dec1bdbbaa0b80f8b9a033c4c90481ddfd1f381b5e63d974625860d7f8f6b5","observation_id":"9a4f7279-e83b-4ab4-986b-a61b6cf0eac1","resolution":{"observed_at":"2026-05-10T22:29:30.136237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2304.11477","last_updated":"2023-09-27T07:29:44Z","snapshot_observed_at":"2026-08-01T15:58:01.346044Z","submitted_at":"2023-04-22T20:34:03Z","title":"LLM+P: Empowering Large Language Models with Optimal Planning Proficiency","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-14T18:36:18.342052Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2304.11477"},"observation_digest":"sha256:4aff4e4c50e61f355aa3164cdb4f38b3666bed11b7bf85ce4f0c9a55c34568f1","observation_id":"2844c17a-77aa-4896-baf2-ddf06f5b48cf","resolution":{"observed_at":"2026-05-14T18:36:18.410581Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2304.13734","last_updated":"2023-10-17T09:34:30Z","snapshot_observed_at":"2026-08-01T19:59:13.992395Z","submitted_at":"2023-04-26T02:49:38Z","title":"The Internal State of an LLM Knows When It's Lying","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-16T00:08:36.530560Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2304.13734"},"observation_digest":"sha256:6bcc225e9352b5cade977161e74eabc6db55cea2e3f5c9ad30cd44c1e8a338a4","observation_id":"efad6fc9-822f-42e5-a7a5-99b56c91b13e","resolution":{"observed_at":"2026-05-16T00:08:36.592913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-24T09:02:31.211260Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2304.14178"},"observation_digest":"sha256:d25e64254deed4e90304daf670053e4040500c5420a8db6face21c7758a3b285","observation_id":"9e89c9d5-617c-40b2-8dd6-4055bd7caac9","resolution":{"observed_at":"2026-05-24T09:04:15.068093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T08:41:04.743886Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2304.15010"},"observation_digest":"sha256:a835d0290b6a9b1870bbe266ff730ae7655173a5837cd7b0f9499a96e17bd8b1","observation_id":"e7edaf90-8665-4772-8823-72cc880c046a","resolution":{"observed_at":"2026-05-15T08:41:04.846297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T09:55:35.452649Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2305.07895"},"observation_digest":"sha256:f3a8473a9d342d7ffa8de49528ec66d2b8b9bb16273d13f1d4595c23f7f41273","observation_id":"f43a8c3e-77df-480f-a432-95bbaf898ee0","resolution":{"observed_at":"2026-05-17T09:55:35.587553Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T13:11:40.995345Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2305.16291"},"observation_digest":"sha256:606b0303952e75c6363a9565f2431e3f82219a175d2ff71e80d563263ac3fb61","observation_id":"a61b9212-9f65-4561-84eb-0a62b84de972","resolution":{"observed_at":"2026-05-10T22:29:30.136237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2305.17144","last_updated":"2023-06-01T09:18:01Z","snapshot_observed_at":"2026-07-06T15:34:05.442952Z","submitted_at":"2023-05-25T17:59:49Z","title":"Ghost in the Minecraft: Generally Capable Agents for Open-World Environments via Large Language Models with Text-based Knowledge and Memory","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T18:37:20.889942Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2305.17144"},"observation_digest":"sha256:446ad6d1a6a5e9f1a129b411b94595237c604dddc06bafb467c9edf739fdae3c","observation_id":"59b95322-c39d-4de3-93f7-441576791ead","resolution":{"observed_at":"2026-05-15T18:37:20.942500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2305.18323","last_updated":"2023-05-23T00:16:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T00:16:48Z","title":"ReWOO: Decoupling Reasoning from Observations for Efficient Augmented Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T18:15:55.525596Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2305.18323"},"observation_digest":"sha256:114394d9a8bade2a10c92a081822c5c8de6c9256baf8c00fa1d4811c6d245263","observation_id":"48e82d2d-e45e-47ff-959b-2efdcf5126df","resolution":{"observed_at":"2026-05-15T18:15:55.694905Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-24T08:27:35.798991Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2306.00978"},"observation_digest":"sha256:df843adc4a5e2627f8409d2198cf540b7702e2eef0ee769b376f4ae480e0363a","observation_id":"c385e7b0-7ee2-41d2-b470-94c63f61d571","resolution":{"observed_at":"2026-05-24T08:29:11.372361Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T20:25:33.854923Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2306.13394"},"observation_digest":"sha256:3db9feffeb02f2d9425578adf02c2021edbecc83208b8da73958fc5cb64a32d0","observation_id":"83f65583-5e0c-4be7-8785-73654365fcce","resolution":{"observed_at":"2026-05-10T22:29:30.136237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:37077719632ac2558af7348573e3aef28e33d1233632afbcd829c1665327cf74","observation_id":"b59ebb8b-5cb6-462e-afaf-277bde92bbc8","resolution":{"observed_at":"2026-05-16T02:56:42.331731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T05:19:47.907355Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2306.14824"},"observation_digest":"sha256:35e0cd4102655d619901199fe48b459fd30d784aa8784fac4dd23f40206a0ef6","observation_id":"8b5d5616-a38c-47be-88a7-e57303cb0b83","resolution":{"observed_at":"2026-05-12T05:19:48.014398Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2307.04964","last_updated":"2023-07-18T08:44:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-11T01:55:24Z","title":"Secrets of RLHF in Large Language Models Part I: PPO","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T13:17:42.848578Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2307.04964"},"observation_digest":"sha256:be1d4dd92166e3af834346a359c878b531e430ddd350f46100798da12acc00f4","observation_id":"67047b39-235c-4e3a-b88e-505211a4a1c2","resolution":{"observed_at":"2026-05-17T13:17:42.937746Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-13T08:57:22.299028Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2307.05973"},"observation_digest":"sha256:8e7d33de3d7e2d34ecd88c94bcde60359a00966249c9b06bab375a3548e1bdf1","observation_id":"ba69446c-6dd3-4e1a-bc10-8135129201cc","resolution":{"observed_at":"2026-05-13T08:57:22.542159Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-19T20:28:38.900026Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2307.06435"},"observation_digest":"sha256:9e4393cd9e2149dd5fb673cea14d158f8fb5a5897930b3c91d3e3c3c74ffb272","observation_id":"f54abbe3-1a4b-47c5-a506-a21f0472364b","resolution":{"observed_at":"2026-05-19T20:28:39.081971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T01:52:01.163900Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2308.01390"},"observation_digest":"sha256:1c7a78a63870c7169e4f585894726a89e9e775dd73013eb5521a3e0ef4d61058","observation_id":"af5bd3bc-25e3-4141-971c-53f902e070d2","resolution":{"observed_at":"2026-05-14T01:52:01.409552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"reference_index":204,"source":"arxiv_source","source_observed_at":"2026-05-20T13:03:57.828598Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2308.08089"},"observation_digest":"sha256:9485b7981513defcad417b940ed0d11ef8c5ea117e6a3ed4c337b11a30ba5f41","observation_id":"2362ebfb-3aeb-48ed-ac34-cfa67633ce2d","resolution":{"observed_at":"2026-05-20T13:03:57.952986Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2309.02427","last_updated":"2024-03-15T15:44:11Z","snapshot_observed_at":"2026-08-03T00:38:27.580701Z","submitted_at":"2023-09-05T17:56:20Z","title":"Cognitive Architectures for Language Agents","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T19:33:44.146134Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2309.02427"},"observation_digest":"sha256:960078ecabcc4dfbafd01701bf1a712feebfea22d8edca18fb6195247bba5e53","observation_id":"5e1b54e4-d41e-4a1f-a8f9-af89238c1717","resolution":{"observed_at":"2026-05-16T19:33:44.317111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T17:58:17.699042Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2309.14525"},"observation_digest":"sha256:d3bc5909e55dd65577139a5772be46b8c77ee481b31c4ba0c5604b3cc2c89441","observation_id":"40e88d1b-ac75-47ea-81db-2c4a6e036608","resolution":{"observed_at":"2026-05-15T17:58:17.836952Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:4c1a4c676c6cb8615184caaef760238cb17c3afa397a14bfecf8510f1e880e3d","observation_id":"f0331151-8237-4e7d-9eca-407cad275eaa","resolution":{"observed_at":"2026-05-17T13:48:48.724699Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2309.16797","last_updated":"2023-09-28T19:01:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T19:01:07Z","title":"Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-16T08:12:30.984870Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2309.16797"},"observation_digest":"sha256:80f4d3d568d3e1b6b9932feeed1e871d087e41b2ae9f2362c55ff03b3a7709a0","observation_id":"918f790b-79ea-458c-ab0b-98910dfd3274","resolution":{"observed_at":"2026-05-16T08:12:31.442707Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T23:26:06.183574Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2309.17421"},"observation_digest":"sha256:869afde72b876e62be95d131c9edb079761c289748aa7eb1f55cfc5e854396f8","observation_id":"9ab82333-e7c2-47d0-8aa8-daffb8a7dd87","resolution":{"observed_at":"2026-05-15T23:26:06.272791Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2310.02635","last_updated":"2026-04-23T15:06:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-04T07:56:42Z","title":"Reinforcement Learning with Foundation Priors: Let the Embodied Agent Efficiently Learn on Its Own","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-24T06:40:00.328012Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2310.02635"},"observation_digest":"sha256:40fc08914e6a06477e2dfa6cea4934088b4e0015c2f798743419dc978d12afcd","observation_id":"9f6c2646-4c75-4abf-aa30-060dd56f3344","resolution":{"observed_at":"2026-05-24T06:44:02.584833Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"reference_index":200,"source":"arxiv_source","source_observed_at":"2026-05-13T20:06:44.480769Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2310.05737"},"observation_digest":"sha256:991888d330dedd292de62655f772886c2d9c5ff1ef3b59a3538cf395a3ceb045","observation_id":"44dac76c-e983-42fc-85d3-767f562ab7d4","resolution":{"observed_at":"2026-05-13T20:06:44.706232Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2310.06114","last_updated":"2024-09-26T17:14:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-09T19:42:22Z","title":"Learning Interactive Real-World Simulators","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-16T02:15:18.265190Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2310.06114"},"observation_digest":"sha256:20c97d4173d3f7a02895b245ea2c46aee2f893797d311cd7c48b5161781683a3","observation_id":"eee8fc93-af35-490e-9edc-4edc446f0197","resolution":{"observed_at":"2026-05-16T02:15:18.405183Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-07-06T16:34:04.003157Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T05:54:58.940428Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2310.10639"},"observation_digest":"sha256:03e473658c8f3785d6e73bb7950f163a7f640dc27217f1062dc69219bf824d99","observation_id":"cd92feae-8d32-4127-81e4-3287c6ac2597","resolution":{"observed_at":"2026-05-16T05:54:59.162016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2310.16828","last_updated":"2024-03-21T17:56:19Z","snapshot_observed_at":"2026-07-31T05:32:29.431480Z","submitted_at":"2023-10-25T17:57:07Z","title":"TD-MPC2: Scalable, Robust World Models for Continuous Control","version":2},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-14T17:27:35.733800Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2310.16828"},"observation_digest":"sha256:0f349e57561ca22e5ba2195c42d1fa270b9e04b3f230f0115853a7d90a473ed0","observation_id":"cc147c8e-ef71-4204-9c81-5b2527ea353c","resolution":{"observed_at":"2026-05-14T17:27:35.982838Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T21:44:27.562453Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2311.01378"},"observation_digest":"sha256:cff25b07ef81deec37568cef16f0357932b35d5241003e64d5be2dace10789c5","observation_id":"0fde5446-ce46-40d3-8080-6026e75ffaf5","resolution":{"observed_at":"2026-05-16T21:44:27.655058Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2311.01468","last_updated":"2023-10-30T19:29:00Z","snapshot_observed_at":"2026-08-02T18:45:20.640717Z","submitted_at":"2023-10-30T19:29:00Z","title":"Remember what you did so you know what to do next","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-25T08:20:54.753641Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2311.01468"},"observation_digest":"sha256:9522e600187accf3067a3e77c91889d73acc422358f3f82f687615b93f82e96b","observation_id":"7d18a581-6c1c-4952-a4fc-95a30b3e9649","resolution":{"observed_at":"2026-05-25T08:25:34.254592Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T15:46:06.334088Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2311.03079"},"observation_digest":"sha256:ebd4f729b7837932db936d009a29213284b2611d05339404bb7e601fddd65b08","observation_id":"adf8a310-159f-45f3-8dcb-db23fc9b56e4","resolution":{"observed_at":"2026-05-15T15:46:06.522386Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2312.13139","last_updated":"2023-12-21T05:34:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-20T16:00:43Z","title":"Unleashing Large-Scale Video Generative Pre-training for Visual Robot Manipulation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-13T16:32:05.538507Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2312.13139"},"observation_digest":"sha256:d96661331ba1b28517ca04febfae502ec37e43d2703254d0cce1eb97f0c994e6","observation_id":"31e8a08f-f84d-4c03-b1cf-cf0b0883dbbc","resolution":{"observed_at":"2026-05-13T16:32:05.702046Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T17:51:05.465548Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2312.14125"},"observation_digest":"sha256:ce7cff73e45c4d78778f1fb215fc3fb9bb8741b996e94a55dbc75c0f952a6346","observation_id":"d2bb2690-eed2-4093-ae7c-c962639163d2","resolution":{"observed_at":"2026-05-15T17:51:05.666225Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T22:46:09.693156Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2312.14238"},"observation_digest":"sha256:10bdb4c3648d9308bc4a480343d5933f06381e4287d5f19550098b74a91d3136","observation_id":"88468e8d-7784-4899-9b32-48d9f7184fd7","resolution":{"observed_at":"2026-05-13T22:46:09.876897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2401.03568","last_updated":"2024-01-25T21:20:27Z","snapshot_observed_at":"2026-07-30T06:39:40.880794Z","submitted_at":"2024-01-07T19:11:18Z","title":"Agent AI: Surveying the Horizons of Multimodal Interaction","version":2},"reference_index":119,"source":"arxiv_source","source_observed_at":"2026-05-18T14:25:58.876978Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2401.03568"},"observation_digest":"sha256:8bee6627d5f94235434ae38cd6f9f113b943015fa9d6cee1ea3a228ed0bd5ba0","observation_id":"9042e4e2-01a4-45e9-aed2-683fc4b0a119","resolution":{"observed_at":"2026-05-18T14:25:59.340568Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-07-06T17:22:03.122430Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T05:30:27.667126Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2401.16420"},"observation_digest":"sha256:59d24383b1998a3a10de6268938a895ea35ed2e866da3e62e2d7e719ad21e0b1","observation_id":"26584fc9-8f8d-4ebc-b1d5-9d7fb50f6475","resolution":{"observed_at":"2026-05-17T05:30:27.719250Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-07-06T17:34:57.509162Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T04:55:20.362512Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2402.15852"},"observation_digest":"sha256:571d79ce71aac42b5737e94660ff9b1258140eeff5cfc658100e70668dd3f651","observation_id":"1263e5be-8c9d-43e1-9995-f521a508bcc0","resolution":{"observed_at":"2026-05-18T04:55:20.445697Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-17T06:53:27.642020Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2403.01823"},"observation_digest":"sha256:736e30c0f6f645eb360a92307ceaa0fe2585020690e431a328130bcfdbbf79c6","observation_id":"a03fb367-6ac8-4016-8ed1-8efcaae7ce79","resolution":{"observed_at":"2026-05-17T06:53:27.735933Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:11c78d9a23fa6996a3722d00ea491d02684697da182f45094c1f8f8b07aa00da","observation_id":"02ce5c85-46d4-4d83-ab83-ad289e7fc8c3","resolution":{"observed_at":"2026-05-16T04:09:36.320359Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-07-06T17:44:45.924645Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-13T18:18:27.211034Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2403.09631"},"observation_digest":"sha256:5fb508cf0068fddc11e2a198f7a5a4d4444b102e25fe810610b64ee26308d024","observation_id":"79465bc0-9128-4873-b79b-f6626afb40a9","resolution":{"observed_at":"2026-05-13T18:18:27.245035Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2404.18416","last_updated":"2024-05-01T17:12:10Z","snapshot_observed_at":"2026-07-06T18:06:49.190172Z","submitted_at":"2024-04-29T04:11:28Z","title":"Capabilities of Gemini Models in Medicine","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-15T17:13:22.759147Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2404.18416"},"observation_digest":"sha256:24667b2f681ee12cd7d6b280ff0a750239954d90dd9c77e14eefc75396c9c007","observation_id":"cbf2d667-6f10-4697-9837-1669c1c76fc6","resolution":{"observed_at":"2026-05-15T17:13:23.006080Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2405.07987","last_updated":"2024-07-25T09:33:50Z","snapshot_observed_at":"2026-08-01T15:05:23.324854Z","submitted_at":"2024-05-13T17:58:30Z","title":"The Platonic Representation Hypothesis","version":5},"reference_index":233,"source":"arxiv_source","source_observed_at":"2026-05-15T06:03:56.328012Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2405.07987"},"observation_digest":"sha256:e70066adce4f5fa5939262c7e5849a00e92a964ed066643df8ddb613a3dcecc6","observation_id":"3b6380f8-77d7-4507-b2c2-0912d0d8779c","resolution":{"observed_at":"2026-05-15T06:03:56.507115Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T00:26:15.163358Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2405.12213"},"observation_digest":"sha256:a83daaec89595f4c1933d04bff6205b00a30b8cfba0332ff43b18df830f212e1","observation_id":"922d9af2-9fe3-4c01-b43d-e3fc3250ffeb","resolution":{"observed_at":"2026-05-11T00:26:15.703429Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T14:46:35.942338Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2406.09246"},"observation_digest":"sha256:f719d846c8aca4a22d796082d836c5b832546ac1b0b7b5d2f56a858192eccec0","observation_id":"9470930f-2e22-40e9-ae66-9da1e7b4f620","resolution":{"observed_at":"2026-05-10T22:29:30.136237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-03T08:18:14.565310Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:8b81013d2a51f62c758165f05745737eb955599f79943cb668c48124faf6a792","observation_id":"4e9a8100-73c2-4ba1-a044-33f7c5769e73","resolution":{"observed_at":"2026-05-17T10:46:28.583353Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2408.10188","last_updated":"2024-12-13T02:32:06Z","snapshot_observed_at":"2026-07-06T19:03:00.486641Z","submitted_at":"2024-08-19T17:48:08Z","title":"LongVILA: Scaling Long-Context Visual Language Models for Long Videos","version":6},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T03:51:25.396887Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2408.10188"},"observation_digest":"sha256:8e9b2eff16a1372eb5d4759b78a73031591427ef13e40ca14eec997f7de59bdb","observation_id":"ea921a89-baf1-462c-9244-d255d3a4832d","resolution":{"observed_at":"2026-05-17T03:51:25.482472Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T07:59:32.638758Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2408.13257"},"observation_digest":"sha256:e15c675770974cab10c1a2b195f44f2813404a7d5ca9f2419592554c67b6a3f0","observation_id":"5113b5f0-e972-4b78-ba35-7313b2af6d6f","resolution":{"observed_at":"2026-05-16T07:59:32.841139Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T07:46:30.553633Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2410.07864"},"observation_digest":"sha256:ac4ccc6710622ba4031632a6309528cea659ca50bf88303a47ed2544beb946a6","observation_id":"be0fd2e6-b2ad-4a4a-91e6-cfa436c0366a","resolution":{"observed_at":"2026-05-11T07:46:30.666368Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2410.23218","last_updated":"2024-10-30T17:10:19Z","snapshot_observed_at":"2026-07-30T04:21:00.152864Z","submitted_at":"2024-10-30T17:10:19Z","title":"OS-ATLAS: A Foundation Action Model for Generalist GUI Agents","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-13T09:29:27.173784Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2410.23218"},"observation_digest":"sha256:6214f611841477d995d25900452bef5a6e2afadca4a4db72c2c3599f2443b049","observation_id":"22071d76-cdc5-4a55-8986-348c5d881b6c","resolution":{"observed_at":"2026-05-13T09:29:27.343773Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2410.23262","last_updated":"2025-09-23T04:19:59Z","snapshot_observed_at":"2026-08-03T01:56:40.154546Z","submitted_at":"2024-10-30T17:46:31Z","title":"EMMA: End-to-End Multimodal Model for Autonomous Driving","version":3},"reference_index":191,"source":"arxiv_source","source_observed_at":"2026-05-15T05:08:54.368109Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2410.23262"},"observation_digest":"sha256:086789fb71f9b6acbfdca8940afc6cdb1836d9c3b3ae2d0c827d390bb6a2d476","observation_id":"8408a01b-1c64-4b77-9d0d-1d97d06d5472","resolution":{"observed_at":"2026-05-15T05:08:54.460154Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T12:38:24.425784Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2410.24164"},"observation_digest":"sha256:5ab793fada3d1cd4363bff85ccbcee424462ea8ae0d4467e3363a30c1f4e4bb3","observation_id":"b201e70e-56da-42ed-9ee4-7f5f261b8aea","resolution":{"observed_at":"2026-05-10T22:29:30.136237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2411.10446","last_updated":"2026-04-16T20:29:38Z","snapshot_observed_at":"2026-08-02T10:07:28.951415Z","submitted_at":"2024-11-15T18:59:51Z","title":"VeriGraph: Scene Graphs for Execution Verifiable Robot Planning","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-23T17:12:31.645346Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2411.10446"},"observation_digest":"sha256:18872fc49874c2ff7247880fefc5b68a4ee2cad1a9547f705da6f67f55e9b866","observation_id":"51625069-9ce4-4537-82c0-84b0ce89bc62","resolution":{"observed_at":"2026-05-23T17:13:13.766619Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2411.19182","last_updated":"2026-05-07T04:53:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:35:25Z","title":"SOWing Information: Cultivating Contextual Coherence with MLLMs in Image Generation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-23T08:37:13.529654Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2411.19182"},"observation_digest":"sha256:dde01828f6753757e83be36f266e324ba37db283abaf8418c36d6d982abb2dac","observation_id":"e8b8ebcd-a10e-49d7-94e3-054448bdaab3","resolution":{"observed_at":"2026-05-23T08:37:44.695709Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2412.07160","last_updated":"2026-04-26T01:15:25Z","snapshot_observed_at":"2026-08-02T08:51:24.009214Z","submitted_at":"2024-12-10T03:41:07Z","title":"Motion-aware Contrastive Learning for Temporal Panoptic Scene Graph Generation","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-23T07:23:51.435139Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2412.07160"},"observation_digest":"sha256:6aa84a80623911d27295016f3b108e25196885a282060a328463e44ad6dbe43d","observation_id":"160e633c-f8ef-4b2a-b949-64ab1338d218","resolution":{"observed_at":"2026-05-23T07:25:28.521741Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-02T17:44:41.340688Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-15T18:27:22.760982Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2412.10345"},"observation_digest":"sha256:fad8626f1225b7d08f81df08be588b36835c0030799016b284a63f2df782c0f9","observation_id":"e1ae76c8-380a-4300-a750-309566723e12","resolution":{"observed_at":"2026-05-15T18:27:22.879453Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2412.13050","last_updated":"2026-05-12T10:24:10Z","snapshot_observed_at":"2026-07-06T20:08:38.939649Z","submitted_at":"2024-12-17T16:13:56Z","title":"Modality-Inconsistent Continual Learning of Multimodal Large Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-23T06:50:12.315919Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2412.13050"},"observation_digest":"sha256:8510ce90b8004d9d5d2c891eb7acaa6182d848592be4482630b1428b99ce600b","observation_id":"c63f7160-8da2-4290-9278-66676e7af971","resolution":{"observed_at":"2026-05-23T06:52:40.192933Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:b48c9e6e218eccae50ce4d5de90b033d7cca164026445788e9442640760442c9","observation_id":"a54155e5-b5b8-4145-9dc9-ca23203faeab","resolution":{"observed_at":"2026-05-11T08:52:31.964936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T05:53:26.066674Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2502.04326"},"observation_digest":"sha256:6042852f50cfe5c6929c318cd0fbcaf25399049338fbae1317297de78267098e","observation_id":"aff7c028-1642-48aa-8402-795b5b24490f","resolution":{"observed_at":"2026-05-17T05:53:26.281814Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2502.19417","last_updated":"2025-07-15T17:44:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T18:58:41Z","title":"Hi Robot: Open-Ended Instruction Following with Hierarchical Vision-Language-Action Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-15T22:53:37.120692Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2502.19417"},"observation_digest":"sha256:6c4b13ddf0a101ade3dcde76ea70e4f38ef785df620c770a0be8e0d5334bb0e7","observation_id":"2a3ad65f-e7ed-476b-b96b-4df071b5b615","resolution":{"observed_at":"2026-05-15T22:53:37.344281Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2503.10631","last_updated":"2025-06-23T07:37:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-13T17:59:52Z","title":"HybridVLA: Collaborative Diffusion and Autoregression in a Unified Vision-Language-Action Model","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-15T22:00:48.667428Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2503.10631"},"observation_digest":"sha256:fe84f1a4cce8274ce292462a6f3d60536be43ac012cffd17280d531a5ea58975","observation_id":"a8f50b03-d4bf-46d0-9fec-17c88edbaddf","resolution":{"observed_at":"2026-05-15T22:00:49.182851Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T19:09:10.112304Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2503.14734"},"observation_digest":"sha256:eb57b7e98df8d9460179be5f6276f8d6a904c533545c27c1d5773001f5fcf589","observation_id":"a785531e-2b06-42e6-a472-203fb1be99aa","resolution":{"observed_at":"2026-05-10T22:29:30.136237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T05:21:44.903048Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2503.22020"},"observation_digest":"sha256:0d43cedd1c9c5a32a271d591f0b9e139d32a0e2962b700a969dd79e290ad9277","observation_id":"d5e232ec-da20-4e3c-8254-d6b11cb46119","resolution":{"observed_at":"2026-05-16T05:21:45.257773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-22T18:02:23.305313Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2504.16054"},"observation_digest":"sha256:da04c981c321e66f1b736253014cab9189186685309197f2ac10b4f77db7f70f","observation_id":"fc9d53e5-909f-454f-8b1a-a95d15c0e966","resolution":{"observed_at":"2026-05-22T18:05:00.999789Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-04T19:02:40.317582Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T15:53:29.412890Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2504.19854"},"observation_digest":"sha256:2e15b14160e35a3fc2df57efb0dfea462ee37ad8aaa2537290386210c7293922","observation_id":"ef462909-7f9e-4948-abf1-d7b69473c166","resolution":{"observed_at":"2026-05-16T15:53:29.447866Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2505.03233","last_updated":"2025-08-27T03:43:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-06T06:59:28Z","title":"GraspVLA: a Grasping Foundation Model Pre-trained on Billion-scale Synthetic Action Data","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T20:55:52.109166Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2505.03233"},"observation_digest":"sha256:b50e0e3c2894845be92fd8e868f2b3e9fc67fa85b316a6566746b2f2fd8828df","observation_id":"e0a948c7-efcf-45aa-bd55-25a2851e2e3b","resolution":{"observed_at":"2026-05-17T20:55:52.324344Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2505.17015","last_updated":"2026-05-22T13:26:59Z","snapshot_observed_at":"2026-08-02T12:28:29.672279Z","submitted_at":"2025-05-22T17:59:39Z","title":"Multi-SpatialMLLM: Multi-Frame Spatial Understanding with Multi-Modal Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-25T08:38:02.944230Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2505.17015"},"observation_digest":"sha256:62374ed420e47be7b15f818e427cf0ab6a27446166f5199d68719b99f7ffbe3e","observation_id":"2e5f4096-288d-4977-8568-a16440b0a44a","resolution":{"observed_at":"2026-05-25T08:40:33.079258Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2505.19237","last_updated":"2026-04-19T18:56:45Z","snapshot_observed_at":"2026-07-06T21:30:09.658226Z","submitted_at":"2025-05-25T17:26:28Z","title":"Sensorimotor Self-Recognition in Multimodal Large Language Model-Driven Robots","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T13:29:34.151546Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2505.19237"},"observation_digest":"sha256:fcb05a03f46bf804c7b09145d623bd4ca65c78847f19c9957e1e381a6cbbda39","observation_id":"14921338-3d23-4ef3-b191-c22200b59d40","resolution":{"observed_at":"2026-05-19T13:32:19.259827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2506.04565","last_updated":"2026-05-08T15:50:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-05T02:34:43Z","title":"From Standalone LLMs to Integrated Intelligence: A Survey of Compound Al Systems","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T11:49:36.574471Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2506.04565"},"observation_digest":"sha256:1cab025e50af7f57eef4a88d318f18af39d012052132b0790771b907cfdf627d","observation_id":"0f3717bb-0979-4d6a-b905-db5ae4c5c2e4","resolution":{"observed_at":"2026-05-19T11:52:16.449091Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T15:42:41.363422Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2507.04447"},"observation_digest":"sha256:a7b9839830d96fe08f478d9829a66b135b46716911bee13ec860b8bc0744a4b9","observation_id":"084ee922-7067-481e-a22f-0448d7797dec","resolution":{"observed_at":"2026-05-16T15:42:41.427827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2507.05331","last_updated":"2025-07-07T17:56:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:56:01Z","title":"A Careful Examination of Large Behavior Models for Multitask Dexterous Manipulation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-25T04:32:56.397350Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2507.05331"},"observation_digest":"sha256:5f13f8d9df6a31ee2839a3a5ed46daefb8975e20f31c7fb90e23344ced83ffc8","observation_id":"2924e9c3-14e0-4bd0-bc68-52495b83f842","resolution":{"observed_at":"2026-05-25T04:32:56.634193Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-07-06T22:00:18.950986Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T08:04:12.433863Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2507.15493"},"observation_digest":"sha256:39ca84d2aba2e5284564eeb7c15c02bae96b53e63c220266bd1c5bd4ec4e7ff4","observation_id":"62ed886b-dfc4-4a56-a692-7e364c738bcd","resolution":{"observed_at":"2026-05-17T08:04:12.532207Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2508.10016","last_updated":"2026-05-22T12:46:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-06T16:17:29Z","title":"Training-Free Multimodal Large Language Model Orchestration","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T00:12:39.834892Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2508.10016"},"observation_digest":"sha256:cd69d895c42163f3b93a345e85d6d9ac69020365bea2e493c3c527ebe157935d","observation_id":"681e7877-35cb-47b5-a6f1-9e5dd7c70425","resolution":{"observed_at":"2026-05-19T00:12:54.110441Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2508.10016","last_updated":"2026-05-22T12:46:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-06T16:17:29Z","title":"Training-Free Multimodal Large Language Model Orchestration","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-25T08:02:15.950975Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2508.10016"},"observation_digest":"sha256:7d1242d056fa6d6432b6434bc5dacda6fc109dbd7ddf57244856038ad305dc49","observation_id":"fef614d7-d952-4f64-9233-86413224dec1","resolution":{"observed_at":"2026-05-25T08:05:30.703364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-04T20:20:31.884483Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08715","last_updated":"2025-09-10T16:09:49Z","snapshot_observed_at":"2026-08-04T20:20:21.378728Z","submitted_at":"2025-09-10T16:09:49Z","title":"BcQLM: Efficient Vision-Language Understanding with Distilled Q-Gated Cross-Modal Fusion","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T20:20:31.884483Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2509.08715"},"observation_digest":"sha256:95fcc2573033b2538c58d01ca4c85c720f53c6ceac5ec1fa2feb9084f7ca433a","observation_id":"b1b100a7-4b74-4ea2-9e53-6e88cee99c79","resolution":{"observed_at":"2026-08-04T20:20:31.884483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-04T19:47:08.883747Z","title":"Haotian Liu, Chunyuan Li, Qingyang Wu, and Yong Jae Lee","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09090","last_updated":"2025-09-11T01:52:25Z","snapshot_observed_at":"2026-08-04T19:47:08.413522Z","submitted_at":"2025-09-11T01:52:25Z","title":"SQAP-VLA: A Synergistic Quantization-Aware Pruning Framework for High-Performance Vision-Language-Action Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T19:47:08.883747Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2509.09090"},"observation_digest":"sha256:ecaafc28dcb8a2c40cf3e8d54c8e240fc5e10cf51a24059600dd3d4cf00c54e3","observation_id":"74e66191-80ba-4e3d-90c3-8155285b68f7","resolution":{"observed_at":"2026-08-04T19:47:08.883747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-04T20:07:03.289338Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09737","last_updated":"2025-09-10T18:01:04Z","snapshot_observed_at":"2026-08-04T20:07:01.227940Z","submitted_at":"2025-09-10T18:01:04Z","title":"World Modeling with Probabilistic Structure Integration","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T20:07:03.289338Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2509.09737"},"observation_digest":"sha256:d430c5bc37586e91383cb7e7de380ead1bfd2d4063243755456c75135d05fec3","observation_id":"bb6c623b-87a9-4fd5-a2e9-600c3f6d79ca","resolution":{"observed_at":"2026-08-04T20:07:03.289338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-04T18:25:37.332342Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10004","last_updated":"2025-09-12T06:58:17Z","snapshot_observed_at":"2026-08-04T18:25:29.740099Z","submitted_at":"2025-09-12T06:58:17Z","title":"Unsupervised Hallucination Detection by Inspecting Reasoning Processes","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T18:25:37.332342Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2509.10004"},"observation_digest":"sha256:5bbefc188a9a2db13eb9b06daaa46d8ca32145fffed374e0c8a8d86d28ff58a7","observation_id":"e1baf8b1-648a-4ad7-8800-a2793e56f74f","resolution":{"observed_at":"2026-08-04T18:25:37.332342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-04T08:12:10.058079Z","title":"PALM-E: An embodied multimodal language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.22052","last_updated":"2026-07-09T14:33:48Z","snapshot_observed_at":"2026-08-04T08:12:08.256558Z","submitted_at":"2025-10-24T22:21:08Z","title":"A Vision Toward Energy-Efficient Domain-Specific Artificial Intelligence Models and Agents","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T08:12:10.058079Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2510.22052"},"observation_digest":"sha256:234925da8544a782ede6604125023876b3041de37ce2a13b10a2b298b8dd404a","observation_id":"a4df57e5-3c09-46bf-8fae-56d98aa526de","resolution":{"observed_at":"2026-08-04T08:12:10.058079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-04T00:03:22.907790Z","title":"Palm- e: An embodied multimodal language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.03075","last_updated":"2026-07-08T21:10:49Z","snapshot_observed_at":"2026-08-04T00:03:21.684731Z","submitted_at":"2025-11-04T23:42:23Z","title":"A Collaborative Reasoning Framework for Anomaly Diagnostics in Underwater Robotics","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T00:03:22.907790Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2511.03075"},"observation_digest":"sha256:97e248de51ac208c69d6f3178500ad11c28594176c49fd395db6e73595e41053","observation_id":"a1aaa130-4a6f-4434-be1a-76188a9e8cde","resolution":{"observed_at":"2026-08-04T00:03:22.907790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2511.14148","last_updated":"2026-05-07T13:40:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-18T05:21:11Z","title":"AsyncVLA: Asynchronous Flow Matching for Vision-Language-Action Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-17T21:28:18.630934Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2511.14148"},"observation_digest":"sha256:b036d5a52bc7c78a5fcb734e9304d0f5893265130f06c0ef711843170deaa71b","observation_id":"dba930d4-e738-403e-9386-61288e5c2f41","resolution":{"observed_at":"2026-05-17T21:30:18.269867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2511.17411","last_updated":"2026-04-27T17:16:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-21T17:09:43Z","title":"SPEAR-1: Scaling Beyond Robot Demonstrations via 3D Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T20:21:12.375936Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2511.17411"},"observation_digest":"sha256:789fa12c551e54f96849ddb9be9b773e1073699e90a2d026d40bb5d83e5b30cb","observation_id":"4ecf3f31-478a-4501-b09e-5d764a27f447","resolution":{"observed_at":"2026-05-17T20:22:04.617134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2512.15840","last_updated":"2026-05-08T06:37:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:35:54Z","title":"Large Video Planner Enables Generalizable Robot Control","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T21:26:32.048309Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2512.15840"},"observation_digest":"sha256:cb6aaf6102990bf79463fceebb9abb8901c43059e1fdc2ea5f38c778951beaaa","observation_id":"505b478b-7ba9-40dd-ae48-5b4240396403","resolution":{"observed_at":"2026-05-16T21:28:33.993855Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2601.07060","last_updated":"2026-04-04T05:08:38Z","snapshot_observed_at":"2026-07-06T22:41:24.948774Z","submitted_at":"2026-01-11T21:00:58Z","title":"PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T15:05:21.907878Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2601.07060"},"observation_digest":"sha256:c022013621827f2d7dab813250cf296cd95aca8b123857a446d1fe1dde1bbedc","observation_id":"97332b31-f0c2-4758-9b7f-837ed0c264a2","resolution":{"observed_at":"2026-05-16T15:08:01.718261Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2601.08454","last_updated":"2026-05-17T09:37:30Z","snapshot_observed_at":"2026-07-06T22:41:33.987055Z","submitted_at":"2026-01-13T11:28:46Z","title":"Real2Sim via Active Perception with Behavior Trees Automatically Generated by VLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T15:07:54.930273Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2601.08454"},"observation_digest":"sha256:cd7c0a5b2da811e5c63011ca1a7bb608db47e3186dff9004e16877e866e8e2f6","observation_id":"96cde638-0e7c-4008-8640-8864aa6f6ee1","resolution":{"observed_at":"2026-05-21T15:10:16.665533Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2602.08392","last_updated":"2026-04-04T07:19:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-09T08:47:14Z","title":"ST-BiBench: Benchmarking Multi-Stream Multimodal Coordination in Bimanual Embodied Tasks for MLLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T06:00:02.043029Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2602.08392"},"observation_digest":"sha256:b7eab16f2eb60dbec07f3e0075ac1c0dd325e874e4aa3dead79d04bcd5d51ad7","observation_id":"42483006-231d-482f-a6f1-8f5d8d567429","resolution":{"observed_at":"2026-05-16T06:00:40.640861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2602.08813","last_updated":"2026-05-12T17:22:35Z","snapshot_observed_at":"2026-08-03T06:12:38.160707Z","submitted_at":"2026-02-09T15:50:05Z","title":"Robust Policy Optimization to Prevent Catastrophic Forgetting","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T05:33:42.965249Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2602.08813"},"observation_digest":"sha256:bc5e42d775383325f43d8e8c21a5a6af61a92e7588ed145a3d0ce05d344aa418","observation_id":"b5e77811-fd14-4ebd-b11c-f058f01278b2","resolution":{"observed_at":"2026-05-16T05:37:24.325187Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-11T16:18:15.003371Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2602.15922"},"observation_digest":"sha256:00ff73e62cf6801635103589f6569a420de49323ccc757238075ab64ad7a80c5","observation_id":"415cdc25-37c9-4baa-85be-fdaec00b3489","resolution":{"observed_at":"2026-05-11T16:18:15.891584Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2602.20231","last_updated":"2026-04-09T04:26:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-23T18:41:41Z","title":"UniLACT: Depth-Aware RGB Latent Action Learning for Vision-Language-Action Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:31.988002Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2602.20231"},"observation_digest":"sha256:ff4658c5eedcac8cc7ec4a97b9ea9197fb7d81614b185d23663137b981f5e64d","observation_id":"35e096b6-a059-4961-9b99-0070b986c192","resolution":{"observed_at":"2026-05-15T20:20:17.549476Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2602.20323","last_updated":"2026-05-03T05:21:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-23T20:18:35Z","title":"PhysMem: Scaling Test-Time Memory for Embodied Physical Reasoning","version":6},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T20:05:30.324309Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2602.20323"},"observation_digest":"sha256:7328dd93cc8fd5d403dc22247b29cf286ead4fd3150e866831f91f17cf932a42","observation_id":"22460ac1-2ede-49e5-a9f0-d060d797912f","resolution":{"observed_at":"2026-05-15T20:06:33.859979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-02T21:10:58.087934Z","title":"RIA” is short for Reflection-in-action, “ROA","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2602.21198","last_updated":"2026-05-25T08:37:57Z","snapshot_observed_at":"2026-08-02T21:10:56.360909Z","submitted_at":"2026-02-24T18:55:18Z","title":"Learning from Trials and Errors: Reflective Test-Time Planning for Embodied LLMs","version":3},"reference_index":1977,"source":"pdf_text","source_observed_at":"2026-08-02T21:10:58.087934Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2602.21198"},"observation_digest":"sha256:e40b3aa9265c98ffba27e1f8165a5cd42d1d32912e6e35221b474b90ba643f44","observation_id":"2ed83f21-211d-4ce4-be14-f74dfadc1992","resolution":{"observed_at":"2026-08-02T21:10:58.087934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-02T20:29:41.309509Z","title":"Driess, D.; Xia, F.; Sajjadi, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.23232","last_updated":"2026-03-01T07:17:53Z","snapshot_observed_at":"2026-08-02T20:29:40.028804Z","submitted_at":"2026-02-26T17:11:08Z","title":"ReCoN-Ipsundrum: An Inspectable Recurrent Persistence Loop Agent with Affect-Coupled Control and Mechanism-Linked Consciousness Indicator Assays","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-02T20:29:41.309509Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2602.23232"},"observation_digest":"sha256:96271defe653b537600cc06188661f6726d23b04c6471e1f88a59f9ed95cda61","observation_id":"4dd14148-f670-4c3e-9c2e-7dec83809345","resolution":{"observed_at":"2026-08-02T20:29:41.309509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2603.00655","last_updated":"2026-04-14T16:56:45Z","snapshot_observed_at":"2026-07-06T22:47:24.369805Z","submitted_at":"2026-02-28T13:57:19Z","title":"Mema: Memory-Augmented Adapter for Enhanced Vision-Language Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T17:53:29.860496Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2603.00655"},"observation_digest":"sha256:480034751605b72117318d632308292ec1f0f5b93e0e01884eb16ad08a566a58","observation_id":"33caab44-b41a-4789-a319-954c6c0c8a1b","resolution":{"observed_at":"2026-05-15T17:56:25.088912Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-15T13:27:51.848177Z","title":"Duan, H., Yang, J., Qiao, Y ., Fang, X., Chen, L., Liu, Y ., Dong, X., Zang, Y ., Zhang, P., Wang, J., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.07109","last_updated":"2026-05-30T07:36:55Z","snapshot_observed_at":"2026-07-15T13:27:48.715737Z","submitted_at":"2026-03-07T08:40:09Z","title":"Vision Language Models Cannot Reason About Physical Transformation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-15T13:27:51.848177Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2603.07109"},"observation_digest":"sha256:1172d80dd5832ff5d20144297febf60b0a165805bbd7557caa650de150a8ab68","observation_id":"000115f5-a140-47c1-affb-70c41af7f58c","resolution":{"observed_at":"2026-07-15T13:27:51.848177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2603.10126","last_updated":"2026-05-11T15:13:54Z","snapshot_observed_at":"2026-07-06T22:48:35.345421Z","submitted_at":"2026-03-10T18:03:29Z","title":"AR-VLA: True Autoregressive Action Expert for Vision-Language-Action Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T12:50:02.670780Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2603.10126"},"observation_digest":"sha256:b17314dbd453379dabf39642cc5ceebe45c96c8cd2255a28887863da1c2f8812","observation_id":"d982ae49-7132-4484-9f3f-0c3dc35cb62f","resolution":{"observed_at":"2026-05-15T12:50:37.156650Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-02T18:13:07.837052Z","title":"arXiv preprint arXiv:2303.03378 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.14604","last_updated":"2026-07-15T00:55:50Z","snapshot_observed_at":"2026-08-02T18:13:05.647574Z","submitted_at":"2026-03-15T20:57:51Z","title":"Tactile Modality Fusion for Vision-Language-Action Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T18:13:07.837052Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2603.14604"},"observation_digest":"sha256:3207b18de1f2853d65b840f09352b0c3231596228254b17500c965544eb0172f","observation_id":"861dd294-8eba-463c-a0ed-3e00aef39b82","resolution":{"observed_at":"2026-08-02T18:13:07.837052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":"2303.03378","doi":"10.48550/arxiv.2303.03378","metadata_source":"pith","pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-07-11T00:27:51.904332Z","title":"PaLM-E: An Embodied Multimodal Language Model","venue":"cs.LG","work_id":"5b99811a-1d93-47e2-9d59-f4045a0b74a2","year":2023},"citing_paper":{"arxiv_id":"2603.23607","last_updated":"2026-04-06T17:50:16Z","snapshot_observed_at":"2026-07-31T19:10:09.444383Z","submitted_at":"2026-03-24T18:00:08Z","title":"LongTail Driving Scenarios with Reasoning Traces: The KITScenes LongTail Dataset","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T00:30:56.156113Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2603.23607"},"observation_digest":"sha256:fa28152fe0c67119bab5343c591fbddfa5a61bfb5a06b978d5903e24f1b62754","observation_id":"62100a11-86c7-447f-aacb-8e84e3bed7e2","resolution":{"observed_at":"2026-05-15T00:33:23.342498Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T19:19:06.044727+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2303.03378/citation-record","integrity":"/paper/2303.03378/integrity","json":"/paper/2303.03378/citation-record.json","paper":"/paper/2303.03378"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":"2204.01691","doi":"10.48550/arxiv.2204.01691","metadata_source":"pith","pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-07-10T13:37:06.821716Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","venue":"cs.RO","work_id":"037320f1-b0a9-4cbe-a639-bfb25409ce71","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:d15763aa307a1217e932682a52abc81232d1aa11cae7075c01e02835e82d91c2","observation_id":"8d5980c1-8d64-4b0f-8f14-a23bce35f2a3","resolution":{"observed_at":"2026-05-10T22:29:29.801274Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2204.14198","doi":"10.48550/arxiv.2204.14198","metadata_source":"pith","pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","venue":"cs.CV","work_id":"a110f764-38dc-41b2-a802-53744ecea1fc","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:1e6c3cfdc7b57448ab47e98837d00eb0e009172ad425cb5c566cf1e88efb6b20","observation_id":"02f15836-2537-456b-b3bf-1d45accaf8a4","resolution":{"observed_at":"2026-05-12T04:22:31.147880Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":"2108.07258","doi":"10.1016/j.specom.2008.12.003","metadata_source":"pith","pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"On the Opportunities and Risks of Foundation Models","venue":"cs.LG","work_id":"a18039e9-928d-47c9-a836-32656a71bf71","year":2021},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:03a6a6de716822bf2f8589cd251e1adc4f8cdd378b96c573fd6493de7918343e","observation_id":"303298d0-28e9-4451-b9d2-c4fde0a67946","resolution":{"observed_at":"2026-05-10T22:29:29.750349Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":"2212.06817","doi":"10.48550/arxiv.2212.06817","metadata_source":"pith","pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-07-11T00:07:42.794081Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","venue":"cs.RO","work_id":"e11bda85-8531-46bc-a07f-d0ade3643ab1","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:a4deca5f2e7cbc2b319c1377f5bea551413800a3a746f0c3fd9d2734737fca42","observation_id":"ea8564a8-7678-4399-beb8-d57b5879c0f0","resolution":{"observed_at":"2026-05-10T22:41:14.065009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T09:34:48.543823Z","title":"D., Dhariwal, P., Neelakantan, A., Shyam, P., Sastry, G., Askell, A., et al","venue":null,"work_id":"9806adeb-7378-4bee-a184-3e98c89988dd","year":1901},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:21f1a97bdc9ed917e2b49716e95e540c7b5450d591ab0955000caf3d0f043e10","observation_id":"86941646-4b35-4482-a8e6-5315bddc62d8","resolution":{"observed_at":"2026-05-10T22:29:30.118388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01883","last_updated":"2022-05-04T04:09:23Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T04:09:23Z","title":"All You May Need for VQA are Image Captions","version":1},"cited_work":{"arxiv_id":"2205.01883","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.01883","snapshot_observed_at":"2026-07-04T00:49:19.179579Z","title":"Chen, M., Tworek, J., Jun, H., Yuan, Q., Pinto, H","venue":null,"work_id":"9d6e4be6-a94f-464a-9061-a8e316ae711b","year":null},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2205.01883","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:af786f33c211ed746db32775b4fb44e8ee00c500871ae11912f8a11bec4c54d3","observation_id":"811630a8-0bf9-44f0-8603-2461f295d179","resolution":{"observed_at":"2026-05-10T22:29:29.812541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":"2209.06794","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-07-04T19:30:07.491958Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","venue":"cs.CV","work_id":"29921cff-29c1-4aad-a27d-adac346027ec","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:4459f9c7d335374f91dac1eb6d8d2a52dd338cb1c1334971ca18a4480108cdbd","observation_id":"24c19ffd-ab1b-4d7f-a102-0260ab345d82","resolution":{"observed_at":"2026-05-16T09:29:06.753688Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":"2204.02311","doi":"10.48550/arxiv.2204.02311","metadata_source":"pith","pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-07-10T12:07:03.432645Z","title":"PaLM: Scaling Language Modeling with Pathways","venue":"cs.CL","work_id":"a94f3ef7-2c49-4445-93fe-6ec16aafd966","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:429434415d49376e4c2f648ed0d9b8618a988f431187445773f35263be95446d","observation_id":"45ef8d62-45a7-419a-9967-2137931745d9","resolution":{"observed_at":"2026-05-10T23:45:07.766206Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05442","last_updated":"2023-02-10T18:58:21Z","snapshot_observed_at":"2026-08-04T12:07:24.626442Z","submitted_at":"2023-02-10T18:58:21Z","title":"Scaling Vision Transformers to 22 Billion Parameters","version":1},"cited_work":{"arxiv_id":"2302.05442","doi":"10.48550/arxiv.2302.05442","metadata_source":"arxiv_reference","pith_arxiv_id":"2302.05442","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"2023.doi: 10.48550/arXiv.2302.05442","venue":null,"work_id":"41e6d3bd-fb27-453a-b13d-f48551c5f957","year":2023},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2302.05442","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:cd13b224bfbc78091003152d076e268a2f2dbd525319b125e19fa09dbf3842ba","observation_id":"23729b9b-4725-47c5-9564-2da4060c3202","resolution":{"observed_at":"2026-05-10T22:29:29.833939Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":"1810.04805","doi":"10.1111/jofi.12885","metadata_source":"pith","pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-07-12T02:22:28.232339Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","venue":"cs.CL","work_id":"ed240a10-5b19-406c-baa5-30803f465785","year":2018},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:605db8ccc17a8d0246d90ba3f3beb9018699bb88122b09fb37d0149e07bafc16","observation_id":"ae7593c5-f0e6-43be-8c37-4bf43db9b423","resolution":{"observed_at":"2026-05-10T22:29:29.839743Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:66887114be2336184e16f77647e1baeafeefc44d7b4c049b40d0d33b27d18bfc","observation_id":"1d081a66-bd2b-4288-8371-238113aa6fba","resolution":{"observed_at":"2026-05-10T22:29:29.844548Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14375","last_updated":"2022-09-28T19:04:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-28T19:04:43Z","title":"Improving alignment of dialogue agents via targeted human judgements","version":1},"cited_work":{"arxiv_id":"2209.14375","doi":"10.48550/arxiv.2209.14375","metadata_source":"pith","pith_arxiv_id":"2209.14375","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Improving alignment of dialogue agents via targeted human judgements","venue":"cs.LG","work_id":"6ad5970e-7550-4ae8-a158-7084dec7e3cc","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2209.14375","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:7418ed6e17d1f020dde6dea03683595baf2e7ba6e329868b84999764efa5f361","observation_id":"7d1a0ea5-566c-4df5-b07e-4a56bc74b0ec","resolution":{"observed_at":"2026-05-14T17:54:02.323766Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.04899","last_updated":"2022-12-17T18:12:32Z","snapshot_observed_at":"2026-08-02T00:55:34.921445Z","submitted_at":"2022-09-11T16:28:25Z","title":"Instruction-driven history-aware policies for robotic manipulations","version":3},"cited_work":{"arxiv_id":"2209.04899","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.04899","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instruction-driven history-aware policies for robotic manipulations","venue":null,"work_id":"88750d9e-321b-4dff-a490-9544819e751d","year":null},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2209.04899","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:5604493feb45ed209fece8448c56b8c6dfe9c3afdf32428089312258c18ebef8","observation_id":"297c9fa1-139f-4d70-a3a4-47dcc2a7a35f","resolution":{"observed_at":"2026-05-10T22:29:29.858550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.06336","last_updated":"2022-06-13T17:34:22Z","snapshot_observed_at":"2026-07-06T13:20:17.627012Z","submitted_at":"2022-06-13T17:34:22Z","title":"Language Models are General-Purpose Interfaces","version":1},"cited_work":{"arxiv_id":"2206.06336","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.06336","snapshot_observed_at":"2026-07-02T17:37:14.469995Z","title":"arXiv preprint arXiv:2206.06336 , year=","venue":null,"work_id":"5a59b90d-1746-4397-96b8-3c49e738a5d0","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2206.06336","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:e2faa9b74313ea5fa56ed057e48822acaf2c101a422ef79c1103bbaa42e774cf","observation_id":"74c66787-ce03-4df3-a046-8fa008fb051d","resolution":{"observed_at":"2026-05-10T22:29:29.866806Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.05714","last_updated":"2023-03-08T10:30:41Z","snapshot_observed_at":"2026-07-06T14:03:49.583141Z","submitted_at":"2022-10-11T18:13:20Z","title":"Visual Language Maps for Robot Navigation","version":4},"cited_work":{"arxiv_id":"2210.05714","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.05714","snapshot_observed_at":"2026-07-02T03:46:32.940286Z","title":"Visual language maps for robot navigation","venue":null,"work_id":"59f5631f-048e-40c9-a659-732c335eddd7","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2210.05714","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:4fd7a6498d0b1f9836a41b646bdd9ae6e0246bdeaa34c302be371c44ee273c2f","observation_id":"82328e8e-2e44-473b-9336-2e13dd6899f1","resolution":{"observed_at":"2026-05-10T22:29:29.899114Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03094","last_updated":"2023-05-28T07:32:38Z","snapshot_observed_at":"2026-07-06T14:01:25.012788Z","submitted_at":"2022-10-06T17:50:11Z","title":"VIMA: General Robot Manipulation with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":"2210.03094","doi":"10.48550/arxiv.2210.03094","metadata_source":"pith","pith_arxiv_id":"2210.03094","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Jiang, A","venue":"cs.RO","work_id":"7b5f6cce-bbaa-40ed-8b09-7330832dd736","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2210.03094","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:acfbd10248ef38521f8a52f28b1fed034f52de2451c8ffa3a6bb63ab72462e4a","observation_id":"89eb5b12-26de-4f9c-82e2-b75251f261a7","resolution":{"observed_at":"2026-05-10T22:29:29.904362Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11916","last_updated":"2023-01-29T05:14:17Z","snapshot_observed_at":"2026-07-06T13:13:18.623287Z","submitted_at":"2022-05-24T09:22:26Z","title":"Large Language Models are Zero-Shot Reasoners","version":4},"cited_work":{"arxiv_id":"2205.11916","doi":"10.48550/arxiv.2205.11916","metadata_source":"pith","pith_arxiv_id":"2205.11916","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Large Language Models are Zero-Shot Reasoners","venue":"cs.CL","work_id":"d9b7eb1a-7165-46ff-9f06-d2f0b9d6f95d","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2205.11916","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:b41810548addbdcb506f353023225d49313ed8b6d1ea0568c3b598837c0589f9","observation_id":"eb9b95c6-a477-40d2-9bfd-f07c4b0835f2","resolution":{"observed_at":"2026-05-12T19:04:13.904485Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":"2104.08691","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-07-04T14:59:55.372222Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","venue":"cs.CL","work_id":"1056ba8e-7b3f-4811-be8e-9a3ed9269acb","year":2021},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:2e5098e28845aeb948d92de07c2307411c58a03151a224b18ddd924835de792c","observation_id":"a953ebc0-911b-4701-b30b-b78fe8da32c8","resolution":{"observed_at":"2026-05-11T16:34:05.826717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14858","last_updated":"2022-07-01T02:15:12Z","snapshot_observed_at":"2026-07-06T13:26:06.337115Z","submitted_at":"2022-06-29T18:54:49Z","title":"Solving Quantitative Reasoning Problems with Language Models","version":2},"cited_work":{"arxiv_id":"2206.14858","doi":"10.48550/arxiv.2206.14858","metadata_source":"pith","pith_arxiv_id":"2206.14858","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Solving Quantitative Reasoning Problems with Language Models","venue":"cs.CL","work_id":"17214d12-1ca8-4186-806d-53c6715383a0","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2206.14858","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:ed3086c191416e8d87df4efc5b0aafc59144903a00f0cdd64c67665b9719cf8b","observation_id":"01278255-d868-4db2-b19b-803b333fe507","resolution":{"observed_at":"2026-05-12T22:43:59.458883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-21T13:53:28.356363+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T13:53:28.356363+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-07-06T08:13:26.248817Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":"1908.03557","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-07-04T09:09:43.648844Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","venue":"cs.CV","work_id":"5a9f7670-5c21-4203-8fe1-cc6eb9bc26d5","year":2019},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:b854013758000547e414e9b9ef0a8bcc814bc716713f82f5a4becc7590f4840f","observation_id":"ca722207-024a-4b52-81a1-09397919ae31","resolution":{"observed_at":"2026-05-15T23:59:38.201352Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10282","last_updated":"2022-09-06T15:32:48Z","snapshot_observed_at":"2026-08-03T20:40:39.460375Z","submitted_at":"2021-09-21T16:01:56Z","title":"TrOCR: Transformer-based Optical Character Recognition with Pre-trained Models","version":5},"cited_work":{"arxiv_id":"2109.10282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10282","snapshot_observed_at":"2026-07-04T09:59:45.215932Z","title":"TrOCR: Transformer-based Optical Charac- ter Recognition with Pre-trained Models","venue":null,"work_id":"637fb461-7583-4710-90b4-fc2f424de5db","year":2021},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2109.10282","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:1a0e289beae1be00d950a9783c5b89f5db4a158843161d614afc1c9c137fd213","observation_id":"f885576d-2d45-4e59-adb5-288dda9c0720","resolution":{"observed_at":"2026-05-10T22:29:29.944797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01771","last_updated":"2022-10-29T18:30:13Z","snapshot_observed_at":"2026-07-06T12:34:14.318686Z","submitted_at":"2022-02-03T18:55:52Z","title":"Pre-Trained Language Models for Interactive Decision-Making","version":4},"cited_work":{"arxiv_id":"2202.01771","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2202.01771","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2202.01771 , year=","venue":null,"work_id":"7d6c6cca-39f4-47ae-9595-4fa20f4096aa","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2202.01771","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:d930d413c9e49de5b30a510d2ccb49b84c645aa8ada9093f59053d6d1907e2a7","observation_id":"733b2ae1-ab8b-4aa2-bb54-607b9a731b36","resolution":{"observed_at":"2026-05-10T22:29:29.954072Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07753","last_updated":"2023-05-25T03:50:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-16T07:17:23Z","title":"Code as Policies: Language Model Programs for Embodied Control","version":4},"cited_work":{"arxiv_id":"2209.07753","doi":"10.48550/arxiv.2209.07753","metadata_source":"pith","pith_arxiv_id":"2209.07753","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Code as Policies: Language Model Programs for Embodied Control","venue":"cs.RO","work_id":"2d96fa84-8097-493c-b5b8-379c984a5047","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2209.07753","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:63a36ec0ce4b4548fff6f63e34b8dda55799adb83d1dbcb15ede21312654e298","observation_id":"b1a2fde3-bc68-4418-8d14-22627f5d2edf","resolution":{"observed_at":"2026-05-15T00:38:03.084841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.05247","last_updated":"2021-06-30T17:34:46Z","snapshot_observed_at":"2026-07-06T10:48:07.645786Z","submitted_at":"2021-03-09T06:39:56Z","title":"Pretrained Transformers as Universal Computation Engines","version":2},"cited_work":{"arxiv_id":"2103.05247","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.05247","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pretrained Transformers as universal computation engines","venue":null,"work_id":"da3f1a8d-df8f-42aa-af5a-1632a2ae5af9","year":2021},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2103.05247","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:9dd4bc361cf4e420329e9c06e7e43158e8c38cc2042ada7315f8e413d7203583","observation_id":"fcf4203a-294f-4086-a5e6-9c0a2bab3cab","resolution":{"observed_at":"2026-05-10T22:29:29.969876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07648","last_updated":"2021-07-07T23:43:24Z","snapshot_observed_at":"2026-07-06T09:20:41.240602Z","submitted_at":"2020-05-15T17:08:50Z","title":"Language Conditioned Imitation Learning over Unstructured Data","version":2},"cited_work":{"arxiv_id":"2005.07648","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2005.07648","snapshot_observed_at":"2026-07-03T04:57:38.593923Z","title":"Language conditioned imitation learning over unstructured data","venue":null,"work_id":"3b4e2803-5a69-4c23-a3b7-86047624e46e","year":2005},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2005.07648","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:9a07a111cbbdfff3d59450ed8439a2389903e9ab6b3901359c2e3214be1b8418","observation_id":"f845b85c-d44c-44d9-a7c8-bca9235d2992","resolution":{"observed_at":"2026-05-10T22:29:29.974642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.06407","last_updated":"2022-10-12T17:03:41Z","snapshot_observed_at":"2026-07-31T18:20:25.514611Z","submitted_at":"2022-10-12T17:03:41Z","title":"Interactive Language: Talking to Robots in Real Time","version":1},"cited_work":{"arxiv_id":"2210.06407","doi":"10.48550/arxiv.2210.06407","metadata_source":"arxiv_reference","pith_arxiv_id":"2210.06407","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Interactive language: Talking to robots in real time","venue":null,"work_id":"14f18d78-e030-41b7-bfce-adfa4c043c74","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2210.06407","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:3998dc8d45e3b9fbd0c932db05ef85be01faea2313a7fa65bf7ab6bc8d1cb97c","observation_id":"bba9eada-1ce2-4d47-a1d4-bb4401214cfd","resolution":{"observed_at":"2026-05-10T22:29:29.983883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12050","last_updated":"2023-04-27T15:14:01Z","snapshot_observed_at":"2026-07-06T14:45:29.763181Z","submitted_at":"2023-01-28T02:04:07Z","title":"Do Embodied Agents Dream of Pixelated Sheep: Embodied Decision Making using Language Guided World Modelling","version":2},"cited_work":{"arxiv_id":"2301.12050","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.12050","snapshot_observed_at":"2026-07-03T22:49:01.084887Z","title":"Do embodied agents dream of pixelated sheep?: Embodied decision making using language guided world modelling","venue":null,"work_id":"6ab5c91a-6f0e-405e-9619-ceb93bfd7ab6","year":2023},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2301.12050","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:c5dda33b7cbc4a7b02f3e03f828041c7ac3ba2ec6c74641ba6421eb5d8b48ba9","observation_id":"92fbd9ce-f5de-4aa8-bc4b-917fd279b3e1","resolution":{"observed_at":"2026-05-10T22:29:29.990431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01344","last_updated":"2022-02-03T00:17:00Z","snapshot_observed_at":"2026-08-04T20:41:41.817730Z","submitted_at":"2022-02-03T00:17:00Z","title":"Formal Mathematics Statement Curriculum Learning","version":1},"cited_work":{"arxiv_id":"2202.01344","doi":"10.48550/arxiv.2202.01344","metadata_source":"arxiv_reference","pith_arxiv_id":"2202.01344","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:2202.01344 , year=","venue":null,"work_id":"899fcf0d-69ed-435b-b3a5-0c32024bb4f5","year":2025},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2202.01344","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:77bbd4d7b8700cbec55c93c6fdfc10f2bcd4d175e233f2519abf20f27d242e74","observation_id":"706073ba-a5e9-47a0-8e05-3bf21917435d","resolution":{"observed_at":"2026-05-10T22:29:29.994704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"cited_work":{"arxiv_id":"2205.06175","doi":"10.48550/arxiv.2205.06175","metadata_source":"pith","pith_arxiv_id":"2205.06175","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"A Generalist Agent","venue":"cs.AI","work_id":"4b0a87cd-8d54-4abc-9698-c4cb20995600","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2205.06175","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:36aaa55a2d59ff6791c2f11682a6636254051b4150417756a5342d716702e4ea","observation_id":"6f5579bb-94b4-4f69-bf05-f04ed0a8dff1","resolution":{"observed_at":"2026-05-13T06:24:50.082909Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11297","last_updated":"2022-04-03T15:42:57Z","snapshot_observed_at":"2026-07-06T11:21:27.749737Z","submitted_at":"2021-06-21T17:55:59Z","title":"TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?","version":4},"cited_work":{"arxiv_id":"2106.11297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.11297","snapshot_observed_at":"2026-07-04T16:39:57.309052Z","title":"Token- learner: What can 8 learned tokens do for images and videos?","venue":null,"work_id":"776df1b9-c9ce-4d27-929b-a598656a2cfa","year":2021},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2106.11297","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:18e191d53fc66f5879c78f39683162c87a5b18654f3957fb6145c459e6cee54f","observation_id":"30516c5a-679c-47c5-afd6-0be2ed571833","resolution":{"observed_at":"2026-05-10T22:29:30.012482Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04429","last_updated":"2022-07-26T10:46:15Z","snapshot_observed_at":"2026-07-06T13:29:35.729595Z","submitted_at":"2022-07-10T10:41:50Z","title":"LM-Nav: Robotic Navigation with Large Pre-Trained Models of Language, Vision, and Action","version":2},"cited_work":{"arxiv_id":"2207.04429","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2207.04429","snapshot_observed_at":"2026-07-01T19:36:08.368610Z","title":"Lm-nav: Robotic navigation with large pre- trained models of language, vision, and action","venue":null,"work_id":"29788303-4129-481b-b7aa-ec46173d3cba","year":2005},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2207.04429","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:0736eaeafbe86c41e922da33778ae14913bc7cfaf04cb36c8831dbac0e7c2cfe","observation_id":"6879b259-3c74-4613-a2c8-59e00d13d838","resolution":{"observed_at":"2026-05-10T22:29:30.017202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.01517","last_updated":"2022-05-02T12:04:59Z","snapshot_observed_at":"2026-08-04T15:32:11.783625Z","submitted_at":"2021-10-04T15:36:32Z","title":"Skill Induction and Planning with Latent Language","version":2},"cited_work":{"arxiv_id":"2110.01517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.01517","snapshot_observed_at":"2026-06-29T23:04:01.439973Z","title":"Sharma, A","venue":null,"work_id":"afd66d2f-b419-4989-bf18-8747ba46657a","year":2021},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2110.01517","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:63a35e5861f183aeb8775fee585940d95547e86a722b87022ae760e300ffd697","observation_id":"543ae5af-f3c4-4947-a350-7707bfbd69d3","resolution":{"observed_at":"2026-05-10T22:29:30.028289Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05451","last_updated":"2022-11-11T08:14:32Z","snapshot_observed_at":"2026-08-04T11:23:47.564894Z","submitted_at":"2022-09-12T17:51:05Z","title":"Perceiver-Actor: A Multi-Task Transformer for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":"2209.05451","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.05451","snapshot_observed_at":"2026-07-04T11:09:47.104368Z","title":"Perceiver-actor: A multi-task transformer for robotic manipulation","venue":null,"work_id":"b20db57f-09e7-4916-b4b5-9e7b95f2bd97","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2209.05451","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:633496fa1633aaed87045dc800fed66b9d7f097612a138002118d42085c33a79","observation_id":"2ec82c29-58e0-45e9-a046-338b31e8d5c0","resolution":{"observed_at":"2026-05-10T22:29:30.039748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11302","last_updated":"2022-09-22T20:29:49Z","snapshot_observed_at":"2026-07-06T13:55:23.465697Z","submitted_at":"2022-09-22T20:29:49Z","title":"ProgPrompt: Generating Situated Robot Task Plans using Large Language Models","version":1},"cited_work":{"arxiv_id":"2209.11302","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.11302","snapshot_observed_at":"2026-07-04T10:49:46.309072Z","title":"ProgPrompt: Generating Situated Robot Task Plans using Large Language Models","venue":"cs.RO","work_id":"3b97ea38-e7d6-4a6b-9857-ef7e271dc3d2","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2209.11302","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:173bc03e0981150e13bfb2cf5d1f2a1c48248fd7a7a3011c12440e89cbae1ef7","observation_id":"c0bf4e8f-a860-45aa-924c-6c0bcf3661b8","resolution":{"observed_at":"2026-05-17T04:22:17.799460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"cited_work":{"arxiv_id":"2201.08239","doi":"10.48550/arxiv.2201.08239","metadata_source":"pith","pith_arxiv_id":"2201.08239","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"LaMDA: Language Models for Dialog Applications","venue":"cs.CL","work_id":"1b66d0a5-f6ae-4332-8025-c662dc64b238","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2201.08239","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:00781781f3c951aa1b493b2fe1ad51856422d29e36776a10b0f96d61212ba8d0","observation_id":"52901c5e-8564-413a-a4dd-a12d540e7d93","resolution":{"observed_at":"2026-05-10T22:29:30.059000Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01560","last_updated":"2024-07-08T05:56:47Z","snapshot_observed_at":"2026-08-02T14:50:04.461434Z","submitted_at":"2023-02-03T06:06:27Z","title":"Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents","version":3},"cited_work":{"arxiv_id":"2302.01560","doi":"10.48550/arxiv.2302.01560","metadata_source":"pith","pith_arxiv_id":"2302.01560","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents","venue":"cs.AI","work_id":"94908c37-3d13-4530-adc9-1d6814616759","year":2023},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2302.01560","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:0f77d487d9036980023a3f2e998393995cec4795f761d67ebd989b4f701dfe42","observation_id":"4e8bf568-b553-4fd3-a621-682da4214420","resolution":{"observed_at":"2026-05-16T03:27:40.929615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":"2201.11903","doi":"10.48550/arxiv.2201.11903","metadata_source":"pith","pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-07-10T21:57:37.821767Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","venue":"cs.CL","work_id":"d1cf6693-a082-403c-ada9-dac7b96341f9","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:4186f0c67db459c2b87664a7f87ddee72eea9f494b6681a72e5e4036834484ee","observation_id":"06fe88a1-4e83-40ed-bd8b-8643fd594637","resolution":{"observed_at":"2026-05-10T22:29:30.103778Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:13.648188+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:13.648188+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11736","last_updated":"2023-07-01T05:38:52Z","snapshot_observed_at":"2026-07-06T14:21:22.601555Z","submitted_at":"2022-11-21T18:56:00Z","title":"Robotic Skill Acquisition via Instruction Augmentation with Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2211.11736","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.11736","snapshot_observed_at":"2026-06-29T17:23:44.957093Z","title":"Robotic skill acquisition via instruction augmentation with vision- language models","venue":null,"work_id":"7c8db303-927e-423e-840c-3a49bd78cb52","year":2023},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2211.11736","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:00910c4a6e459ddea00f0cc26b891a096daa7e5a03f4125f0a576c2377594885","observation_id":"93ea694c-e438-49af-ac54-7457bd0ed1e9","resolution":{"observed_at":"2026-05-10T22:29:30.111909Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00188","last_updated":"2022-01-30T15:52:25Z","snapshot_observed_at":"2026-07-06T11:14:37.660839Z","submitted_at":"2021-06-01T02:32:12Z","title":"PIGLeT: Language Grounding Through Neuro-Symbolic Interaction in a 3D World","version":2},"cited_work":{"arxiv_id":"2106.00188","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.00188","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zellers, A","venue":null,"work_id":"93ef9ae2-7a8e-4c76-b46b-5531988bc59f","year":2021},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2106.00188","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:b93f3f682bbf4173d8eb6e10fec2d0ba27e04b9a7ac4857431eaad60a5111d6b","observation_id":"57b594b3-7414-4806-b7b3-42a2e27569e3","resolution":{"observed_at":"2026-05-10T22:29:29.784246Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03427","last_updated":"2021-06-07T08:48:44Z","snapshot_observed_at":"2026-07-06T11:16:37.233588Z","submitted_at":"2021-06-07T08:48:44Z","title":"Hierarchical Task Learning from Language Instructions with Unified Transformers and Self-Monitoring","version":1},"cited_work":{"arxiv_id":"2106.03427","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.03427","snapshot_observed_at":"2026-06-29T21:23:58.791085Z","title":"Hierarchical task learning from language instructions with unified transformers and self- monitoring","venue":null,"work_id":"ea1ab9f5-d998-42a2-ba2f-dd877a5e9df0","year":2021},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"cited_paper":"/paper/2106.03427","citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:d21147acd85040fd4bcb4434e4d3b4ee8378a8af23ba8f6eeae8056427240637","observation_id":"6e493240-fcb5-40d5-ad5f-86acf5448797","resolution":{"observed_at":"2026-05-10T22:29:29.794554Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"full mixture","venue":null,"work_id":"0664d780-a19e-4140-9f41-7564e47fb341","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:83e49e36b4074f3957066dfa35e89e2892c206607e896d133a33115f0692d5b1","observation_id":"9a2d297a-b69b-4ecc-89c3-bcd07579daa5","resolution":{"observed_at":"2026-05-10T22:29:30.134622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"57761856-35ea-4500-8f7f-88c1b234a8bc","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:7062020b2db70c4d00c89105c3d5a96d86be1d266ad4eb3e2f1678258b7ee2f3","observation_id":"034efaa3-7e5f-4051-8f70-3ebb075075f8","resolution":{"observed_at":"2026-05-10T22:29:30.127437Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"photos/2772823","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"10ac4bad-a735-4b88-9581-31489187c708","year":2022},"citing_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T22:29:29.631351Z"},"links":{"citing_paper":"/paper/2303.03378"},"observation_digest":"sha256:51d0c1f9eb2f316ebeaf35be8e8ba5e117324147cc53588c6c0a96cfa0ddb88c","observation_id":"faa2a7d9-cf9a-4528-91b6-0d9534f22801","resolution":{"observed_at":"2026-05-10T22:29:29.680084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":12,"parse_uncertain":0,"unresolved":0,"verified_exact":28,"verified_fuzzy":2},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 100 inbound Pith citation observations for arXiv:2303.03378."}