{"as_of":"2026-08-08T02:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f97341d9c1173ee1c7cd52ba31c14dd4061ed3c83950715f5e5f6f2f2869347a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:31:13.645079Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T06:36:10.581673Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-08-07T14:31:13.645079Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18536","last_updated":"2025-05-24T06:01:48Z","snapshot_observed_at":"2026-08-07T22:01:21.366221Z","submitted_at":"2025-05-24T06:01:48Z","title":"Reinforcement Fine-Tuning Powers Reasoning Capability of Multimodal Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:13.645079Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2505.18536"},"observation_digest":"sha256:1d0f336cc73ac1cdd0c44d72308154a123f6d5351df8df7d66e1c9f286430fbb","observation_id":"bb8cd184-7364-4401-a920-23f1239dae01","resolution":{"observed_at":"2026-08-07T14:31:13.645079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-08-07T00:40:40.398754Z","title":"Hu, C.-W","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13066","last_updated":"2025-06-16T03:19:31Z","snapshot_observed_at":"2026-08-07T02:53:10.665842Z","submitted_at":"2025-06-16T03:19:31Z","title":"FinLMM-R1: Enhancing Financial Reasoning in LMM through Scalable Data and Reward Design","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:40.398754Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2506.13066"},"observation_digest":"sha256:e608d71767658eda9352173b3d77d76b7b043e21960779fa961cde38f362ba9d","observation_id":"8809531c-3f7a-4032-8af3-4ab46ef679fb","resolution":{"observed_at":"2026-08-07T00:40:40.398754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-08-06T22:36:15.038514Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-06T22:25:23.475002Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:36:15.038514Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2506.21277"},"observation_digest":"sha256:6073a90b5afccd4a3da30d4f2d5e0a811b8df6dd1af2fa40c003f722e389ad3e","observation_id":"2caf0f52-2c2f-4cb8-bcf5-c365bbbc7f9b","resolution":{"observed_at":"2026-08-06T22:36:15.038514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.04623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning","venue":null,"work_id":"1da0bbcc-d537-4e69-b29a-08f24dbbc696","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":264,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:f8992429b648b139992237d49af015362b5fc17a9f08e89140768ac41fcad6fe","observation_id":"2f29198a-1efa-4caf-8739-a82b313520b7","resolution":{"observed_at":"2026-05-18T19:21:48.404714Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.04623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning","venue":null,"work_id":"1da0bbcc-d537-4e69-b29a-08f24dbbc696","year":2025},"citing_paper":{"arxiv_id":"2510.15148","last_updated":"2026-04-04T21:55:10Z","snapshot_observed_at":"2026-07-06T22:32:51.756468Z","submitted_at":"2025-10-16T21:10:22Z","title":"XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T05:45:07.700571Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2510.15148"},"observation_digest":"sha256:09f80c2bb17a5fc305bf03875e5ddcc5c638bf4065ac9f4c260d24711c82ff31","observation_id":"e0a7d057-b8c4-4e62-9dde-6caf0ffe500f","resolution":{"observed_at":"2026-05-18T05:45:56.120572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-07-13T09:25:05.174833Z","title":"Zhenghao Xing, Xiaowei Hu, Chi-Wing Fu, Wen- hai Wang, Jifeng Dai, and Pheng-Ann Heng","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.05521","last_updated":"2026-06-05T00:46:09Z","snapshot_observed_at":"2026-07-13T09:25:03.828170Z","submitted_at":"2026-04-07T07:18:58Z","title":"Development of a 3D-CNN-based Prediction Model for Migration Barriers in Plasma-Wall Interactions","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T09:25:05.174833Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2604.05521"},"observation_digest":"sha256:83201c9c0ec74268d1de10e0d4dae576f5479e35458d4399a6bffdcc6736fa24","observation_id":"6cbf7b30-a75b-4436-97f2-cf6cb8b1392d","resolution":{"observed_at":"2026-07-13T09:25:05.174833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.04623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning","venue":null,"work_id":"1da0bbcc-d537-4e69-b29a-08f24dbbc696","year":2025},"citing_paper":{"arxiv_id":"2604.05522","last_updated":"2026-04-07T07:19:42Z","snapshot_observed_at":"2026-07-06T22:54:12.531121Z","submitted_at":"2026-04-07T07:19:42Z","title":"Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T19:10:52.629490Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2604.05522"},"observation_digest":"sha256:143ee8bb0f64dd0dbf5c5ece40e3acaadab276f3a5e548a5bf058c466bd250db","observation_id":"0a9dfaff-cf0c-4434-995f-49833a1bc469","resolution":{"observed_at":"2026-05-10T23:25:49.792701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.04623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning","venue":null,"work_id":"1da0bbcc-d537-4e69-b29a-08f24dbbc696","year":2025},"citing_paper":{"arxiv_id":"2604.11244","last_updated":"2026-04-15T07:55:01Z","snapshot_observed_at":"2026-07-06T22:59:40.900521Z","submitted_at":"2026-04-13T09:50:36Z","title":"Script-a-Video: Deep Structured Audio-visual Captions via Factorized Streams and Relational Grounding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T15:07:45.595260Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2604.11244"},"observation_digest":"sha256:d8a93ee6848bf2a8b5d4e28230a8a6136b28cbd04ec4990482b9c2f6219fbdd0","observation_id":"cb2b7095-f2cf-4861-8605-52d8989c1bad","resolution":{"observed_at":"2026-05-11T11:11:03.503815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.04623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning","venue":null,"work_id":"1da0bbcc-d537-4e69-b29a-08f24dbbc696","year":2025},"citing_paper":{"arxiv_id":"2604.11554","last_updated":"2026-04-14T09:26:26Z","snapshot_observed_at":"2026-07-06T22:59:54.573362Z","submitted_at":"2026-04-13T14:42:03Z","title":"Relax: An Asynchronous Reinforcement Learning Engine for Omni-Modal Post-Training at Scale","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:52.017037Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2604.11554"},"observation_digest":"sha256:8072c09f6fadfcec7860001680cc4e085cf733ee72f44a03255463e7b9f2b683","observation_id":"87eebf59-fac5-45cc-b15c-4399c9236ab6","resolution":{"observed_at":"2026-05-11T09:16:03.279034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.04623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning","venue":null,"work_id":"1da0bbcc-d537-4e69-b29a-08f24dbbc696","year":2025},"citing_paper":{"arxiv_id":"2604.14520","last_updated":"2026-04-16T01:21:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-16T01:21:14Z","title":"Chain of Modality: From Static Fusion to Dynamic Orchestration in Omni-MLLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T12:05:54.551728Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2604.14520"},"observation_digest":"sha256:005c7b1a005dd1faa4d7337b74eb5215b00b8f782cb8021d3706a7b1a06c49e1","observation_id":"1afb3801-19f9-4cf1-a99e-336a9f694b0a","resolution":{"observed_at":"2026-05-10T12:10:22.117814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.04623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning","venue":null,"work_id":"1da0bbcc-d537-4e69-b29a-08f24dbbc696","year":2025},"citing_paper":{"arxiv_id":"2604.16617","last_updated":"2026-04-17T18:13:27Z","snapshot_observed_at":"2026-08-02T22:28:35.019925Z","submitted_at":"2026-04-17T18:13:27Z","title":"AVRT: Audio-Visual Reasoning Transfer through Single-Modality Teachers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T08:02:53.574120Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2604.16617"},"observation_digest":"sha256:d2db20e662cc5a725492b7212db95a5074f0d6daade7d7afb2dc6a6206d84722","observation_id":"43e2786f-801b-4e1b-aab3-a201e66cfbbc","resolution":{"observed_at":"2026-05-10T09:18:32.200681Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.04623","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04623","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echoink-r1: Exploring audio-visual reasoning in multimodal llms via reinforcement learning","venue":null,"work_id":"1da0bbcc-d537-4e69-b29a-08f24dbbc696","year":2025},"citing_paper":{"arxiv_id":"2605.22012","last_updated":"2026-05-21T05:18:57Z","snapshot_observed_at":"2026-08-05T07:24:30.530987Z","submitted_at":"2026-05-21T05:18:57Z","title":"LatentOmni: Rethinking Omni-Modal Understanding via Unified Audio-Visual Latent Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-22T06:34:57.483234Z"},"links":{"cited_paper":"/paper/2505.04623","citing_paper":"/paper/2605.22012"},"observation_digest":"sha256:90113e7e7907d7ee7955305555ab25adb14853ea920554ecf8d66d4646c8f49a","observation_id":"dcd6a649-c1a0-4046-af9f-6f01963efd5f","resolution":{"observed_at":"2026-05-22T06:36:10.587746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.04623/citation-record","integrity":"/paper/2505.04623/integrity","json":"/paper/2505.04623/citation-record.json","paper":"/paper/2505.04623"},"outbound":[],"paper":{"arxiv_id":"2505.04623","last_updated":"2025-05-07T17:59:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:23:57.893844Z","submitted_at":"2025-05-07T17:59:49Z","title":"EchoInk-R1: Exploring Audio-Visual Reasoning in Multimodal LLMs via Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2505.04623."}