{"as_of":"2026-08-08T13:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d88b3b3325abf26712695a89dd89931fcf9f1d9bf184a82c4c606b7cfeac917b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:15:11.527741Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T19:45:00.682859Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","snapshot_observed_at":"2026-08-08T11:14:33.223909Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07167","snapshot_observed_at":"2026-08-07T15:15:11.527741Z","title":"Deciphering cross-modal alignment in large vision-language models with modality integration rate.arXiv preprint arXiv:2410.07167,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15816","last_updated":"2025-05-21T17:59:52Z","snapshot_observed_at":"2026-08-08T00:44:22.305190Z","submitted_at":"2025-05-21T17:59:52Z","title":"Streamline Without Sacrifice -- Squeeze out Computation Redundancy in LMM","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:11.527741Z"},"links":{"cited_paper":"/paper/2410.07167","citing_paper":"/paper/2505.15816"},"observation_digest":"sha256:d96f8b1705ccbdeb6aae58ab7542aa1bd5a615242c5c89069fa9457a7fe6325f","observation_id":"d6970a0a-68eb-4b8b-8841-49d7ff231925","resolution":{"observed_at":"2026-08-07T15:15:11.527741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","snapshot_observed_at":"2026-08-08T11:14:33.223909Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07167","snapshot_observed_at":"2026-08-07T14:52:07.553797Z","title":"Deciphering cross-modal alignment in large vision-language models with modality integration rate,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-08T12:19:36.067436Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.553797Z"},"links":{"cited_paper":"/paper/2410.07167","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:89feb395036c119f39725ade89fd2673c92c7bc0dd339adfc2a1f397c0e3f523","observation_id":"afd9b67a-ee7f-4db6-a5d8-cecc6819e3b2","resolution":{"observed_at":"2026-08-07T14:52:07.553797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","snapshot_observed_at":"2026-08-08T11:14:33.223909Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07167","snapshot_observed_at":"2026-08-07T12:37:20.984510Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24208","last_updated":"2025-05-30T04:40:08Z","snapshot_observed_at":"2026-08-08T01:25:52.362186Z","submitted_at":"2025-05-30T04:40:08Z","title":"Bootstrapping LLM Robustness for VLM Safety via Reducing the Pretraining Modality Gap","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:37:20.984510Z"},"links":{"cited_paper":"/paper/2410.07167","citing_paper":"/paper/2505.24208"},"observation_digest":"sha256:18ce6949ef86b915c40a6aca4aacbc569e476d9784d84ae5600411846b42d2d7","observation_id":"c11fcb7d-a043-4238-9988-5fe90ad14551","resolution":{"observed_at":"2026-08-07T12:37:20.984510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","snapshot_observed_at":"2026-08-08T11:14:33.223909Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07167","snapshot_observed_at":"2026-08-05T16:32:42.939167Z","title":"Deciphering cross-modal alignment in large vision-language models with modality integration rate","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-06T03:45:09.032927Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:42.939167Z"},"links":{"cited_paper":"/paper/2410.07167","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:985d72733a32ee2959cb8c0567197454e0991a7f4738876faafcf42a7b2b4cdc","observation_id":"ea38c2f4-6165-4719-8c34-37e37b7bb1a4","resolution":{"observed_at":"2026-08-05T16:32:42.939167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","snapshot_observed_at":"2026-08-08T11:14:33.223909Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","version":2},"cited_work":{"arxiv_id":"2410.07167","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07167","snapshot_observed_at":"2026-06-30T19:45:00.682859Z","title":"Deciphering cross-modal alignment in large vision-language models with modality integration rate","venue":null,"work_id":"33308dfc-63eb-4eff-91e5-1c78db23a4fc","year":2024},"citing_paper":{"arxiv_id":"2605.17249","last_updated":"2026-06-04T15:16:16Z","snapshot_observed_at":"2026-08-02T18:37:17.554035Z","submitted_at":"2026-05-17T04:12:56Z","title":"SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T13:31:16.012419Z"},"links":{"cited_paper":"/paper/2410.07167","citing_paper":"/paper/2605.17249"},"observation_digest":"sha256:d620e21415f2073793df844bf175bb7f0dc3e776ebf020fbaef4eccfb7c2e758","observation_id":"37d341dd-0cd8-44ac-9657-7fd031ebfc28","resolution":{"observed_at":"2026-05-20T13:33:19.172520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","snapshot_observed_at":"2026-08-08T11:14:33.223909Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","version":2},"cited_work":{"arxiv_id":"2410.07167","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07167","snapshot_observed_at":"2026-06-30T19:45:00.682859Z","title":"Deciphering cross-modal alignment in large vision-language models with modality integration rate","venue":null,"work_id":"33308dfc-63eb-4eff-91e5-1c78db23a4fc","year":2024},"citing_paper":{"arxiv_id":"2605.17249","last_updated":"2026-06-04T15:16:16Z","snapshot_observed_at":"2026-08-02T18:37:17.554035Z","submitted_at":"2026-05-17T04:12:56Z","title":"SEDualVLN: A Spatially-Enhanced Dual-System for Vision-Language Navigation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T19:42:41.238072Z"},"links":{"cited_paper":"/paper/2410.07167","citing_paper":"/paper/2605.17249"},"observation_digest":"sha256:d25466665a80b2bceeec9e0cc9c97f97bd21af38ebac8980f5c9a3ec839f5725","observation_id":"06f3f885-7a39-4372-90a5-42c8deca1fbc","resolution":{"observed_at":"2026-06-30T19:45:00.684556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","snapshot_observed_at":"2026-08-08T11:14:33.223909Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","version":2},"cited_work":{"arxiv_id":"2410.07167","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07167","snapshot_observed_at":"2026-06-30T19:45:00.682859Z","title":"Deciphering cross-modal alignment in large vision-language models with modality integration rate","venue":null,"work_id":"33308dfc-63eb-4eff-91e5-1c78db23a4fc","year":2024},"citing_paper":{"arxiv_id":"2605.30265","last_updated":"2026-05-28T17:27:55Z","snapshot_observed_at":"2026-08-01T22:14:47.638279Z","submitted_at":"2026-05-28T17:27:55Z","title":"LoMo: Local Modality Substitution for Deeper Vision-Language Fusion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T08:20:05.081980Z"},"links":{"cited_paper":"/paper/2410.07167","citing_paper":"/paper/2605.30265"},"observation_digest":"sha256:0833f29ea05009901342495f0eece850a667e5c79b109764c59597df946a8321","observation_id":"eed17356-21fa-4a12-90e4-9976229c8bf9","resolution":{"observed_at":"2026-06-29T08:23:15.119706Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2410.07167/citation-record","integrity":"/paper/2410.07167/integrity","json":"/paper/2410.07167/citation-record.json","paper":"/paper/2410.07167"},"outbound":[],"paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T11:14:33.223909Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2410.07167."}