{"as_of":"2026-08-11T12:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b14fdbbf330dac7078a6497f7bd3d149014e9f65c7babde3160cf8d96925729","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:18:36.156440Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T11:28:04.249589Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":"2309.07915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-07-03T11:28:04.249589Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":"f306f0d3-c35b-4063-b422-c6beae03c3f8","year":2023},"citing_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-05-15T02:43:47.775691Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2305.03726"},"observation_digest":"sha256:5131a7aa8107a15c191d98f235f8144720c9d141e870e7e45a4049d7d48d0219","observation_id":"c003e649-d936-4595-ac39-8a0569c65b9f","resolution":{"observed_at":"2026-05-15T02:43:47.921205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":"2309.07915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-07-03T11:28:04.249589Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":"f306f0d3-c35b-4063-b422-c6beae03c3f8","year":2023},"citing_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T20:25:33.854923Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2306.13394"},"observation_digest":"sha256:9ee591b100ebea7a76355182ad83278bbb2bc81885a6345ae302600fe967e27a","observation_id":"49c71f5b-2ca1-4f26-ba5c-ee4fda747cc5","resolution":{"observed_at":"2026-05-10T20:25:34.384358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":"2309.07915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-07-03T11:28:04.249589Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":"f306f0d3-c35b-4063-b422-c6beae03c3f8","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":178,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:ab6b43409b8f930ba742eb6e3f2ecb4bc55c353565def5cc4d9755c20f145e20","observation_id":"c32ec879-219d-46c8-a17e-5888f035abde","resolution":{"observed_at":"2026-05-16T02:56:42.114548Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":"2309.07915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-07-03T11:28:04.249589Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":"f306f0d3-c35b-4063-b422-c6beae03c3f8","year":2023},"citing_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-17T13:48:48.661566Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2309.15112"},"observation_digest":"sha256:5de3c58deb797790f4e5f55576c07da0d1db9d8f1f5c216e578734bbcaebedc0","observation_id":"8f8cd8e6-452f-4c3f-a7ac-9da087753530","resolution":{"observed_at":"2026-05-17T13:48:48.730141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":"2309.07915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-07-03T11:28:04.249589Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":"f306f0d3-c35b-4063-b422-c6beae03c3f8","year":2023},"citing_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-17T03:03:26.723464Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2311.07575"},"observation_digest":"sha256:3077ebcf3b55257e08468c6b45374e2867188df4adc84903908a353acde6cc0a","observation_id":"7b199355-444a-4547-a8df-919470dc953e","resolution":{"observed_at":"2026-05-17T03:03:26.811111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":"2309.07915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-07-03T11:28:04.249589Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":"f306f0d3-c35b-4063-b422-c6beae03c3f8","year":2023},"citing_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-15T05:37:41.401736Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2311.16502"},"observation_digest":"sha256:5582befb6a2dccc143d126f0fd50f47bd775373f5c3b2e1da486ed89eec62f3f","observation_id":"dff90377-1243-4301-8102-07998a1a663e","resolution":{"observed_at":"2026-05-15T05:37:41.773286Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":"2309.07915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-07-03T11:28:04.249589Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":"f306f0d3-c35b-4063-b422-c6beae03c3f8","year":2023},"citing_paper":{"arxiv_id":"2312.13771","last_updated":"2026-07-05T07:51:04Z","snapshot_observed_at":"2026-08-10T11:11:57.106246Z","submitted_at":"2023-12-21T11:52:45Z","title":"AppAgent: Multimodal Agents as Smartphone Users","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-17T10:16:43.364787Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2312.13771"},"observation_digest":"sha256:5d7f71e8fd87e135b604ee90b61f8e22720c26f2bd2c8f022f5a63bb081405f6","observation_id":"82d29ec2-bf0b-4894-a809-45bbdbbc10e9","resolution":{"observed_at":"2026-05-17T10:16:43.863403Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":"2309.07915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-07-03T11:28:04.249589Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":"f306f0d3-c35b-4063-b422-c6beae03c3f8","year":2023},"citing_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"reference_index":215,"source":"pdf_text","source_observed_at":"2026-05-11T12:33:32.631346Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2404.18930"},"observation_digest":"sha256:203a306cf76e8efebf82e0f7e1dc7142b248bfa0b8703eb9621929319a5a6dfb","observation_id":"63612e85-d06c-44c0-85a0-51c889966839","resolution":{"observed_at":"2026-05-11T12:33:33.408364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":"2309.07915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-07-03T11:28:04.249589Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":"f306f0d3-c35b-4063-b422-c6beae03c3f8","year":2023},"citing_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"reference_index":270,"source":"arxiv_source","source_observed_at":"2026-05-20T06:20:36.235304Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2408.04840"},"observation_digest":"sha256:332e0b3bd9ea7bb304b406d9c2aee24d03ca591bd98913e89f5a66c73b4e447c","observation_id":"873119cc-23fb-4666-8c34-0fbe0df37024","resolution":{"observed_at":"2026-05-20T06:20:36.589141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":"2309.07915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-07-03T11:28:04.249589Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":"f306f0d3-c35b-4063-b422-c6beae03c3f8","year":2023},"citing_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-14T00:51:48.163349Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2409.02813"},"observation_digest":"sha256:b29497ee96b8caf8f6d67e612c07773592e07c9e665c2759c74ac95d4f0a0b24","observation_id":"6e32069a-5927-46d7-87ed-ff66f9af7781","resolution":{"observed_at":"2026-05-14T00:51:48.489537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-08-11T11:18:36.156440Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15652","last_updated":"2024-12-20T08:07:11Z","snapshot_observed_at":"2026-08-11T11:11:22.635467Z","submitted_at":"2024-12-20T08:07:11Z","title":"Error-driven Data-efficient Large Multimodal Model Tuning","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-11T11:18:36.156440Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2412.15652"},"observation_digest":"sha256:34eb162f9ec8e185ef688b9a2159f989470e0bee7554855a84499a814bda7f45","observation_id":"b0b96954-b851-409c-8d63-955f851ffe3e","resolution":{"observed_at":"2026-08-11T11:18:36.156440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-08-10T22:56:54.862312Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.00358","last_updated":"2025-01-09T03:25:24Z","snapshot_observed_at":"2026-08-10T22:50:40.043012Z","submitted_at":"2024-12-31T09:22:38Z","title":"Embodied VideoAgent: Persistent Memory from Egocentric Videos and Embodied Sensors Enables Dynamic Scene Understanding","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T22:56:54.862312Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2501.00358"},"observation_digest":"sha256:c7529e17f79afd46e97ffe62fa05659a7ae114ef9ca11394d0715229366733d7","observation_id":"5d7c42c9-d3fb-4109-9bfc-10a9d1ece2e5","resolution":{"observed_at":"2026-08-10T22:56:54.862312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-08-07T13:21:27.449934Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22006","last_updated":"2025-05-28T06:12:51Z","snapshot_observed_at":"2026-08-09T20:12:29.668551Z","submitted_at":"2025-05-28T06:12:51Z","title":"Efficiently Enhancing General Agents With Hierarchical-categorical Memory","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:27.449934Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2505.22006"},"observation_digest":"sha256:3c83ac99fd829b66b05702ccf4445004c5c87386ee3b712354000a19eb4bc932","observation_id":"980f9d5a-59ed-459f-943b-52df29e9c27d","resolution":{"observed_at":"2026-08-07T13:21:27.449934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-08-06T21:19:45.166758Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-07T23:46:04.736988Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.166758Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:cc883370066bc22dbaab1abb4c60ee3d319fa372ee6bcc5ef8e14ef530482df0","observation_id":"b7cadc4d-47b2-4570-921e-e97df1d5db9c","resolution":{"observed_at":"2026-08-06T21:19:45.166758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-08-06T17:38:19.968980Z","title":"arXiv:2309.07915 (2023) 2","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10302","last_updated":"2025-07-14T14:05:19Z","snapshot_observed_at":"2026-08-09T06:56:01.559909Z","submitted_at":"2025-07-14T14:05:19Z","title":"DisCo: Towards Distinct and Coherent Visual Encapsulation in Video MLLMs","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T17:38:19.968980Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2507.10302"},"observation_digest":"sha256:7cd80b71680d652c265fe186bacca36ed0153a522c896379f5a0220e6b951a18","observation_id":"17b80f1f-639d-4ed0-8004-9db7e39d7fca","resolution":{"observed_at":"2026-08-06T17:38:19.968980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-08-06T17:09:49.143377Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11761","last_updated":"2025-07-15T21:54:51Z","snapshot_observed_at":"2026-08-10T00:51:21.918029Z","submitted_at":"2025-07-15T21:54:51Z","title":"Beyond Task-Specific Reasoning: A Unified Conditional Generative Framework for Abstract Visual Reasoning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T17:09:49.143377Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2507.11761"},"observation_digest":"sha256:ca10411ed412275db31909ec71ac8c3d017d9bf78e5d060d50dd88d9f1179094","observation_id":"26378829-0ef0-4a8b-8169-bac28bf660ad","resolution":{"observed_at":"2026-08-06T17:09:49.143377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-08-06T15:29:35.387308Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15807","last_updated":"2025-08-06T09:36:34Z","snapshot_observed_at":"2026-08-10T21:27:37.896731Z","submitted_at":"2025-07-21T17:08:18Z","title":"True Multimodal In-Context Learning Needs Attention to the Visual Context","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:35.387308Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2507.15807"},"observation_digest":"sha256:66102e11f7b88b718bd067216500ae509a53e45aa9844b140469cc1353d57943","observation_id":"f304a5c6-2cb3-4968-9053-1d34374fe6bb","resolution":{"observed_at":"2026-08-06T15:29:35.387308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-08-05T19:39:48.064324Z","title":"Mmicl: Empowering vision-language model with multi- modal in-context learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.064324Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:26ecd1b99a2d6c5f800e896723b7ccdcf6915fd7f041ea0cfa33a73e723232db","observation_id":"dc0acddf-0452-4542-8916-34dbb5c29744","resolution":{"observed_at":"2026-08-05T19:39:48.064324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-08-03T21:09:26.512199Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learn- ing.ArXiv, abs/2309.07915, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.16672","last_updated":"2026-06-09T22:19:41Z","snapshot_observed_at":"2026-08-06T04:41:40.984877Z","submitted_at":"2025-11-20T18:59:54Z","title":"EvoLMM: Self-Evolving Large Multimodal Models with Continuous Rewards","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T21:09:26.512199Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2511.16672"},"observation_digest":"sha256:f00f87db87c4d56852256aef3859838212055339c949fed4a748a59c945456bd","observation_id":"c849f00e-97e6-47c5-bef1-9ae2366f57d2","resolution":{"observed_at":"2026-08-03T21:09:26.512199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":"2309.07915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-07-03T11:28:04.249589Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":"f306f0d3-c35b-4063-b422-c6beae03c3f8","year":2023},"citing_paper":{"arxiv_id":"2512.23365","last_updated":"2026-04-09T12:09:38Z","snapshot_observed_at":"2026-07-06T22:40:17.725041Z","submitted_at":"2025-12-29T10:48:54Z","title":"SpatialMosaic: A Multiview VLM Dataset for Partial Visibility","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T19:42:25.626448Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2512.23365"},"observation_digest":"sha256:23d0d60c694c66a2671351b8bcf08b87b14249089a537ecbcfb0ae245c5f0a5f","observation_id":"e528abfb-ef92-4c2d-b553-e4f06f9e33d9","resolution":{"observed_at":"2026-05-16T19:43:20.640781Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-07-13T18:42:33.178622Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning.arXiv preprint arXiv:2309.07915, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.24690","last_updated":"2026-07-07T02:44:32Z","snapshot_observed_at":"2026-07-13T18:42:32.163637Z","submitted_at":"2026-03-25T18:09:33Z","title":"UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T18:42:33.178622Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2603.24690"},"observation_digest":"sha256:ceab6b135aa2fb275a14029d2c131cf69358cbc63b1362d4a99a8cd3d32c3184","observation_id":"cc5a4c69-2201-4625-91c6-b326f0c9c601","resolution":{"observed_at":"2026-07-13T18:42:33.178622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":"2309.07915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-07-03T11:28:04.249589Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":"f306f0d3-c35b-4063-b422-c6beae03c3f8","year":2023},"citing_paper":{"arxiv_id":"2604.13403","last_updated":"2026-04-15T02:12:51Z","snapshot_observed_at":"2026-07-06T23:01:23.771347Z","submitted_at":"2026-04-15T02:12:51Z","title":"Why Multimodal In-Context Learning Lags Behind? Unveiling the Inner Mechanisms and Bottlenecks","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-10T13:41:37.942145Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2604.13403"},"observation_digest":"sha256:7edb6cb7d2e8a74fe61f4241b60cf5d113b6ce9b24f779a31f8132c0f0627d7e","observation_id":"98f7788d-89fb-4221-a3a6-8e2fe4349c35","resolution":{"observed_at":"2026-05-10T13:45:28.188026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":"2309.07915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-07-03T11:28:04.249589Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":"f306f0d3-c35b-4063-b422-c6beae03c3f8","year":2023},"citing_paper":{"arxiv_id":"2604.18562","last_updated":"2026-04-22T02:31:50Z","snapshot_observed_at":"2026-08-04T10:02:00.731719Z","submitted_at":"2026-04-20T17:49:22Z","title":"AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation","version":3},"reference_index":172,"source":"arxiv_source","source_observed_at":"2026-05-10T05:10:44.608959Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2604.18562"},"observation_digest":"sha256:cf068d213cc4b306f046bfe942ac35ee3e300c575454dc2dc7aacbf5d2bb4a3e","observation_id":"96528a01-6670-41a2-9ee4-814b23e732ab","resolution":{"observed_at":"2026-05-10T09:43:49.492561Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":"2309.07915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-07-03T11:28:04.249589Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":"f306f0d3-c35b-4063-b422-c6beae03c3f8","year":2023},"citing_paper":{"arxiv_id":"2606.11853","last_updated":"2026-06-10T09:30:25Z","snapshot_observed_at":"2026-08-02T20:07:37.622537Z","submitted_at":"2026-06-10T09:30:25Z","title":"Task-Aware Structured Memory for Dynamic Multi-modal In-Context Learning","version":1},"reference_index":199,"source":"arxiv_source","source_observed_at":"2026-06-27T10:28:11.440915Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2606.11853"},"observation_digest":"sha256:12c62eb2f377c8568fd604eccee8431004635d4c4559d985106ebea900ee9908","observation_id":"5ac6012a-59d6-48ca-93eb-4dd55a79375c","resolution":{"observed_at":"2026-07-03T09:07:48.378037Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":"2309.07915","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-07-03T11:28:04.249589Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning","venue":null,"work_id":"f306f0d3-c35b-4063-b422-c6beae03c3f8","year":2023},"citing_paper":{"arxiv_id":"2606.12744","last_updated":"2026-06-10T23:14:45Z","snapshot_observed_at":"2026-08-08T10:26:12.213388Z","submitted_at":"2026-06-10T23:14:45Z","title":"GRIP: Feedback-Guided Prompt Retrieval for Large Multimodal Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T09:34:20.560870Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2606.12744"},"observation_digest":"sha256:b9a73947545b1dbe85f632eb0502a0b6e52767591a876a4a2dfff7388c5e8dc2","observation_id":"8d9b819c-2ffe-4f6f-a328-8344868c714b","resolution":{"observed_at":"2026-07-03T11:28:04.251441Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07915","snapshot_observed_at":"2026-07-12T01:50:59.184754Z","title":"arXiv preprint arXiv:2309.07915 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03530","last_updated":"2026-07-03T17:59:58Z","snapshot_observed_at":"2026-08-04T18:44:44.436706Z","submitted_at":"2026-07-03T17:59:58Z","title":"MentalThink: Shaping Thoughts in Mental SVG World","version":1},"reference_index":184,"source":"arxiv_source","source_observed_at":"2026-07-12T01:50:59.184754Z"},"links":{"cited_paper":"/paper/2309.07915","citing_paper":"/paper/2607.03530"},"observation_digest":"sha256:e599c13bb6b7a36d83ea6800784142778c42217f39262fc46400e20ba1adeaa1","observation_id":"0f65fee5-c7bb-441e-af98-09defcb99b27","resolution":{"observed_at":"2026-07-12T01:50:59.184754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2309.07915/citation-record","integrity":"/paper/2309.07915/integrity","json":"/paper/2309.07915/citation-record.json","paper":"/paper/2309.07915"},"outbound":[],"paper":{"arxiv_id":"2309.07915","last_updated":"2024-03-20T16:17:02Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T16:18:37.399390Z","submitted_at":"2023-09-14T17:59:17Z","title":"MMICL: Empowering Vision-language Model with Multi-Modal In-Context Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2309.07915."}