{"as_of":"2026-08-05T14:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:89542d64c92323c76c4c56d873c3c80e1ce20313ed81301fb8b83e9e88fd3616","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T10:40:56.726020Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.18257/citation-record","integrity":"/paper/2605.18257/integrity","json":"/paper/2605.18257/citation-record.json","paper":"/paper/2605.18257"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.11059","last_updated":"2024-09-18T13:27:39Z","snapshot_observed_at":"2026-08-03T14:10:54.513941Z","submitted_at":"2024-09-17T10:38:46Z","title":"OneEncoder: A Lightweight Framework for Progressive Alignment of Modalities","version":2},"cited_work":{"arxiv_id":"2409.11059","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.11059","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teledyne FLIR","venue":null,"work_id":"34412a81-71bf-46a6-a818-bf5870baa51d","year":2018},"citing_paper":{"arxiv_id":"2605.18257","last_updated":"2026-05-18T11:56:19Z","snapshot_observed_at":"2026-07-06T23:29:09.538843Z","submitted_at":"2026-05-18T11:56:19Z","title":"CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T10:40:56.726020Z"},"links":{"cited_paper":"/paper/2409.11059","citing_paper":"/paper/2605.18257"},"observation_digest":"sha256:8e64143d7f7d22a5eac4a5b05766f94643aacc61c93ce5ae0610b6317f934447","observation_id":"6140a115-e541-4bbc-a9f8-f4dab47da93f","resolution":{"observed_at":"2026-05-20T10:43:12.574737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03905","last_updated":"2023-09-11T20:25:16Z","snapshot_observed_at":"2026-07-06T16:15:50.904062Z","submitted_at":"2023-09-07T17:59:45Z","title":"ImageBind-LLM: Multi-modality Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2309.03905","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.03905","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagebind-llm: Multi-modality instruction tun- ing","venue":null,"work_id":"1cdf5dff-7482-43ff-b430-3a3911c5d927","year":2023},"citing_paper":{"arxiv_id":"2605.18257","last_updated":"2026-05-18T11:56:19Z","snapshot_observed_at":"2026-07-06T23:29:09.538843Z","submitted_at":"2026-05-18T11:56:19Z","title":"CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T10:40:56.726020Z"},"links":{"cited_paper":"/paper/2309.03905","citing_paper":"/paper/2605.18257"},"observation_digest":"sha256:bada307685897725fec36a13bb1a211e2522b9b9296960852ee2d22550db439a","observation_id":"6b577162-8e3c-4736-b0e6-d27fdf97ac98","resolution":{"observed_at":"2026-05-20T10:43:12.563700Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":"1705.06950","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-07-09T11:16:11.423695Z","title":"The Kinetics Human Action Video Dataset","venue":"cs.CV","work_id":"c8a3de61-cfd3-4aeb-bcf7-a0372c015748","year":2017},"citing_paper":{"arxiv_id":"2605.18257","last_updated":"2026-05-18T11:56:19Z","snapshot_observed_at":"2026-07-06T23:29:09.538843Z","submitted_at":"2026-05-18T11:56:19Z","title":"CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T10:40:56.726020Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2605.18257"},"observation_digest":"sha256:6af03893fd37f3f524d5944b384ee7ff10bdac7d3b850a4e53112ee876fc5905","observation_id":"b5e16adf-4c27-449a-916c-f30927647afd","resolution":{"observed_at":"2026-05-20T10:43:12.571969Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09067","last_updated":"2022-03-17T03:53:11Z","snapshot_observed_at":"2026-07-06T12:48:59.296356Z","submitted_at":"2022-03-17T03:53:11Z","title":"UNIMO-2: End-to-End Unified Vision-Language Grounded Learning","version":1},"cited_work":{"arxiv_id":"2203.09067","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.09067","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7ffe11b3-55db-403f-8bce-3eccfb30adcf","year":2022},"citing_paper":{"arxiv_id":"2605.18257","last_updated":"2026-05-18T11:56:19Z","snapshot_observed_at":"2026-07-06T23:29:09.538843Z","submitted_at":"2026-05-18T11:56:19Z","title":"CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T10:40:56.726020Z"},"links":{"cited_paper":"/paper/2203.09067","citing_paper":"/paper/2605.18257"},"observation_digest":"sha256:7fd6fdef426fee1b743b8dbd5e06a01808d986d3d327283a6aa4b6744ca51ca7","observation_id":"4200575c-d8cf-4f29-8547-a760be096b83","resolution":{"observed_at":"2026-05-20T10:43:12.569437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16108","last_updated":"2024-05-25T07:45:41Z","snapshot_observed_at":"2026-07-06T18:19:47.765281Z","submitted_at":"2024-05-25T07:45:41Z","title":"OmniBind: Teach to Build Unequal-Scale Modality Interaction for Omni-Bind of All","version":1},"cited_work":{"arxiv_id":"2405.16108","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16108","snapshot_observed_at":"2026-07-04T13:09:50.329446Z","title":"Om- nibind: Teach to build unequal-scale modality interaction for omni-bind of all","venue":null,"work_id":"f78a5234-8f6d-4208-aec0-4837e46f081b","year":2024},"citing_paper":{"arxiv_id":"2605.18257","last_updated":"2026-05-18T11:56:19Z","snapshot_observed_at":"2026-07-06T23:29:09.538843Z","submitted_at":"2026-05-18T11:56:19Z","title":"CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T10:40:56.726020Z"},"links":{"cited_paper":"/paper/2405.16108","citing_paper":"/paper/2605.18257"},"observation_digest":"sha256:b10542edb8f6dc0aa4192ca59d9dd455703806fc30a079800c39292c66b3e878","observation_id":"5fedd36b-7ed5-48c9-83c8-e4da41bf7e13","resolution":{"observed_at":"2026-05-20T10:43:12.560997Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"989eadce-1e97-4d81-8f96-b647fa00550b","year":2023},"citing_paper":{"arxiv_id":"2605.18257","last_updated":"2026-05-18T11:56:19Z","snapshot_observed_at":"2026-07-06T23:29:09.538843Z","submitted_at":"2026-05-18T11:56:19Z","title":"CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T10:40:56.726020Z"},"links":{"citing_paper":"/paper/2605.18257"},"observation_digest":"sha256:887d25425a527904e969544fafa156bd7555a899e11550625b2f3d0c39e79262","observation_id":"58fe95f5-71a2-4324-a70e-f4ad056ea9e3","resolution":{"observed_at":"2026-05-20T10:43:13.002146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14020","last_updated":"2024-07-19T04:42:52Z","snapshot_observed_at":"2026-07-06T18:48:49.546589Z","submitted_at":"2024-07-19T04:42:52Z","title":"NeuroBind: Towards Unified Multimodal Representations for Neural Signals","version":1},"cited_work":{"arxiv_id":"2407.14020","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.14020","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InNeurIPS","venue":null,"work_id":"7ea44dce-86ec-4637-b1ac-6daf386a3606","year":2016},"citing_paper":{"arxiv_id":"2605.18257","last_updated":"2026-05-18T11:56:19Z","snapshot_observed_at":"2026-07-06T23:29:09.538843Z","submitted_at":"2026-05-18T11:56:19Z","title":"CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T10:40:56.726020Z"},"links":{"cited_paper":"/paper/2407.14020","citing_paper":"/paper/2605.18257"},"observation_digest":"sha256:8f28d35dda681d93c2757c18215af016b2d10eb8d8aa8807f7e64a920413115d","observation_id":"cef20055-90ee-405e-b74d-0a33f2904f59","resolution":{"observed_at":"2026-05-20T10:43:12.566385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-07-06T15:56:25.975005Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":"2307.10802","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-06-29T13:43:28.559460Z","title":"MetaTransformer: a unified framework for multimodal learning.arXiv preprint arXiv:2307.10802, 2023b","venue":null,"work_id":"db5448c7-e956-4bcb-b25c-7740e433ee81","year":2023},"citing_paper":{"arxiv_id":"2605.18257","last_updated":"2026-05-18T11:56:19Z","snapshot_observed_at":"2026-07-06T23:29:09.538843Z","submitted_at":"2026-05-18T11:56:19Z","title":"CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T10:40:56.726020Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2605.18257"},"observation_digest":"sha256:219e61e6441ab8555f69f24d4563db251a9d397f150db8688559120f9cbf8f6b","observation_id":"2e4e840f-7192-4aac-80fa-7d2c87bfc363","resolution":{"observed_at":"2026-05-20T10:43:12.558257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"97908858-95b0-40f0-a276-2b9368381882","year":null},"citing_paper":{"arxiv_id":"2605.18257","last_updated":"2026-05-18T11:56:19Z","snapshot_observed_at":"2026-07-06T23:29:09.538843Z","submitted_at":"2026-05-18T11:56:19Z","title":"CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T10:40:56.726020Z"},"links":{"citing_paper":"/paper/2605.18257"},"observation_digest":"sha256:168ba565d9e400445f7af80e8d16a0e0f0ce1273ce4f3e6ad4f0e9bcdf606c08","observation_id":"cf8c8ba9-424b-40c1-9b82-56cae5595db8","resolution":{"observed_at":"2026-05-20T10:43:12.996806Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"We do not use the unbalanced training split with 2M clips","venue":null,"work_id":"161df8dd-699d-472b-bd07-a841a2ca6148","year":2024},"citing_paper":{"arxiv_id":"2605.18257","last_updated":"2026-05-18T11:56:19Z","snapshot_observed_at":"2026-07-06T23:29:09.538843Z","submitted_at":"2026-05-18T11:56:19Z","title":"CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T10:40:56.726020Z"},"links":{"citing_paper":"/paper/2605.18257"},"observation_digest":"sha256:2b765f7bbe98ad27628ee09cf9f64c0cd55bbf525218ade24cce3131217a4aac","observation_id":"09dbcbc5-896f-488a-abca-78ec7b315c95","resolution":{"observed_at":"2026-05-20T10:43:12.998682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"85321e71-e6e0-4cd9-812a-f1d245b6e5a2","year":2019},"citing_paper":{"arxiv_id":"2605.18257","last_updated":"2026-05-18T11:56:19Z","snapshot_observed_at":"2026-07-06T23:29:09.538843Z","submitted_at":"2026-05-18T11:56:19Z","title":"CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T10:40:56.726020Z"},"links":{"citing_paper":"/paper/2605.18257"},"observation_digest":"sha256:d59e84775bf961dab511b67f02cbf05fa3da7164a793dbd818a930e8a28beeb6","observation_id":"16603f8b-5d56-4e33-8332-ad3a0957196c","resolution":{"observed_at":"2026-05-20T10:43:13.000409Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"polar bear","venue":null,"work_id":"11ba00dd-3817-4a06-9ae6-0c695ec3a4b5","year":2015},"citing_paper":{"arxiv_id":"2605.18257","last_updated":"2026-05-18T11:56:19Z","snapshot_observed_at":"2026-07-06T23:29:09.538843Z","submitted_at":"2026-05-18T11:56:19Z","title":"CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T10:40:56.726020Z"},"links":{"citing_paper":"/paper/2605.18257"},"observation_digest":"sha256:8879732f5964b274802bde76fe58c7b48f2cf331f6d97796addc49427f27530b","observation_id":"9d64aee9-0de7-4f9b-8fc9-8fce6524a53a","resolution":{"observed_at":"2026-05-20T10:43:12.994924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.18257","last_updated":"2026-05-18T11:56:19Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:29:09.538843Z","submitted_at":"2026-05-18T11:56:19Z","title":"CodeBind: Decoupled Representation Learning for Multimodal Alignment with Unified Compositional Codebook"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":7,"verified_fuzzy":2},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2605.18257."}