{"as_of":"2026-08-08T23:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cb471d6beb890d617743b82c1dec2abb980d5e7e80de7cc0493a3a91c0a825bc","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:47:44.014826Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.04789/citation-record","integrity":"/paper/2507.04789/integrity","json":"/paper/2507.04789/citation-record.json","paper":"/paper/2507.04789"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-06T19:47:40.030491Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:40.030491Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:94b7a28055f9d2e44933431dc091d8d4d08243b2c5c45e6caf01471ff15af98b","observation_id":"f134ada1-780f-48a4-be4d-1f63cc164808","resolution":{"observed_at":"2026-08-06T19:47:40.030491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:51.908400Z","title":"Vision-language models as a source of rewards","venue":null,"work_id":"ae825f00-9e91-4830-8290-18c1cccc0f69","year":2023},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:40.080984Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:1be080add229affb537c4841bde4ac7db5e958b09e809f91eb0aac1f6beed2d2","observation_id":"a287c5c4-e6d8-4dfd-8dfd-0407e8d7bb64","resolution":{"observed_at":"2026-08-06T19:47:51.972386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:40.142313Z","title":"Spatialvlm: Endow- ing vision-language models with spatial reasoning capabili- ties","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:40.142313Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:a167df8d7fecf3a459e0aa4c5496767d020377fb43a1b67e63a7f2b694b90775","observation_id":"4b02908f-fac7-4629-99ba-9633105e81b9","resolution":{"observed_at":"2026-08-06T19:47:40.142313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:51.694850Z","title":"Towards a unified agent with foundation models","venue":null,"work_id":"99b516c7-1692-4171-a8d5-dcfe8d0a7722","year":2023},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:40.179746Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:1190fc7e5dd429fb28c3f01bc398273c8fcf0d800aff9aee82180e2989a5b111","observation_id":"f1d4c3a6-72d9-47a9-be9a-8ed80b7cc642","resolution":{"observed_at":"2026-08-06T19:47:51.809780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:51.534016Z","title":"Video language planning","venue":null,"work_id":"394d2ec1-1578-4070-b9a5-e24e9d558e73","year":2024},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:40.263441Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:8dd929c357c5aa6b266bb48e105e10f8e14528739f76f14e87ae19a2639c0f19","observation_id":"23a79ce5-2d5d-46e7-8591-be13e497db7e","resolution":{"observed_at":"2026-08-06T19:47:51.651023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:51.360796Z","title":"Manipulate- anything: Automating real-world robots using vision- language models","venue":null,"work_id":"49136ecc-785a-44ed-87f6-c0699486c800","year":2024},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:40.331962Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:5bbe2c7997ddfdaabef912b26e29daa1ebed39596a8f33224210dd1e539c3d13","observation_id":"a4937b0b-b98f-47d0-b8da-e5b9fa2e992d","resolution":{"observed_at":"2026-08-06T19:47:51.455521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:51.161438Z","title":"Phys- ically grounded vision-language models for robotic manip- ulation","venue":null,"work_id":"82805b3d-5e46-402c-8b08-803ee4b31eed","year":2024},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:40.421741Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:68e9f6cb92c042a59c0b4b48af80b9397d8861271b3e677a7a6f75ee16ff707d","observation_id":"f0f9be62-7248-4a83-b51e-bff7ba31dddf","resolution":{"observed_at":"2026-08-06T19:47:51.267732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:51.068922Z","title":"Doremi: Grounding language model by detecting and recov- ering from plan-execution misalignment","venue":null,"work_id":"28eb29c8-8c9f-4cfc-a69d-c9cb561d1da9","year":2024},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:40.507364Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:05ba2da369029401b04ec9bf0aae22749fcb9920b10754ab9968f0e5c9cffa80","observation_id":"46fd493f-6084-4191-90ea-d1646bb4cc50","resolution":{"observed_at":"2026-08-06T19:47:51.078631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:40.622191Z","title":"Mixgen: A new multi- modal data augmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:40.622191Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:3d09fafabe6e270227a74cd05abb2064b65b766ae633c09b06cbad2824bfbcac","observation_id":"909f63de-b7b0-47fa-86d9-2c31311c91f9","resolution":{"observed_at":"2026-08-06T19:47:40.622191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:50.875319Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models","venue":null,"work_id":"76716193-e5bf-4cf6-999a-1c9a2466526c","year":2023},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:40.668131Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:bbcd7875ae016a34224675014162142c0ddbe3ccca3f25b4103bf9ddac22f6db","observation_id":"a69a73d2-41fb-4632-add1-e48336247fac","resolution":{"observed_at":"2026-08-06T19:47:50.920534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:50.690475Z","title":"Robobrain: A unified brain model for robotic manipulation from abstract to concrete","venue":null,"work_id":"374f1dd9-1848-48f0-a174-0580e97e4153","year":2025},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:40.739804Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:9b02366c8ffa65e449bb31d989a30e9d0d5b60dba326dc5aa86f553f9fcb47e9","observation_id":"a2f238db-8987-4812-911c-21b459dfa134","resolution":{"observed_at":"2026-08-06T19:47:50.753133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:50.461637Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":"9679e555-4f42-49a6-81b1-72ef64d9fb62","year":2021},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:40.807513Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:1b33ab45975da565d5d4723b44e1fd1205d3fdfb1806d673d31f22b07e0a380b","observation_id":"1736832a-c8e6-4a07-bbb1-29512151ca3f","resolution":{"observed_at":"2026-08-06T19:47:50.534051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:50.241991Z","title":"De- composed prompting: A modular approach for solving com- plex tasks","venue":null,"work_id":"af449a6f-79ab-4c1b-86c6-dc34bdbeba02","year":2023},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:40.867070Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:3180a2f5b3bca4f0bae4d8e6a5bbf0c34c5ef05a6b18f6bbab54289c5f6c5103","observation_id":"6bbb4804-88f2-4259-bfe3-7ac2b93ef29f","resolution":{"observed_at":"2026-08-06T19:47:50.298515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:40.928757Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:40.928757Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:61d25083fb96ece1be962dc8bafe5985a61673714cf17261688073995268e5b3","observation_id":"768e7873-9fd7-4bfe-9814-3b021123782b","resolution":{"observed_at":"2026-08-06T19:47:40.928757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:50.026532Z","title":"Multimodal sensor fusion with differentiable filters","venue":null,"work_id":"93f8a28f-ba10-41ec-b094-27e9c946423b","year":null},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:40.986288Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:de7021dc216b44c55eb5db9920601398f45853762caf108165ec43364784a84b","observation_id":"3360e7b3-df2e-4695-8faf-1822753c8fbe","resolution":{"observed_at":"2026-08-06T19:47:50.117560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:41.045499Z","title":"What foundation models can bring for robot learning in manipulation: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:41.045499Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:9d2332a7520e4a01bdd88e3fa328d3e09686b4e2a0d485af37867943eca00199","observation_id":"74fe2b5e-accf-4561-8206-e9516c154ca0","resolution":{"observed_at":"2026-08-06T19:47:41.045499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:49.765895Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"4d8c3980-7b76-47c6-b434-c21534c01a18","year":2023},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:41.100895Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:ee8ec1b0533b7f8e5bbf747e8de969b2d0f3378148772e4d73936efb08733604","observation_id":"f6987d0b-d893-4fc4-86ff-5bfd90c13d27","resolution":{"observed_at":"2026-08-06T19:47:49.856803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:49.710224Z","title":"Code as policies: Language model programs for embodied con- trol","venue":null,"work_id":"e82b6452-23ef-4245-8ee7-8dfbcae4e07b","year":2023},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:41.135694Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:e05141ab51ddc23e2b9c6c93646331da1490d3f0866d905c1fb915e93a0f188a","observation_id":"469d33dc-beb8-457e-b52c-98824cd12f77","resolution":{"observed_at":"2026-08-06T19:47:49.716556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:49.410503Z","title":"Reflect: Summa- rizing robot experiences for failure explanation and correc- tion","venue":null,"work_id":"c27d4945-ec50-4ede-8cdb-3bcab51c2310","year":null},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:41.187899Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:750de207745e89f5ae4efa25f5ca9725789bf7eef7ddd7ddcc9178941eb31bd8","observation_id":"be3dc320-6d76-4df1-8112-9b1642ac2f8d","resolution":{"observed_at":"2026-08-06T19:47:49.579110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09583","last_updated":"2025-04-17T08:37:02Z","snapshot_observed_at":"2026-07-06T17:44:41.822709Z","submitted_at":"2024-03-14T17:18:15Z","title":"ExploRLLM: Guiding Exploration in Reinforcement Learning with Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09583","snapshot_observed_at":"2026-08-06T19:47:41.236915Z","title":"Explorllm: Guiding exploration in reinforce- ment learning with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:41.236915Z"},"links":{"cited_paper":"/paper/2403.09583","citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:1f4ad05c75f58a360df2037681c532b70c0d208bb8aa5be0220e8983f5a61b62","observation_id":"41423878-e643-4d71-a570-f1945e5c1435","resolution":{"observed_at":"2026-08-06T19:47:41.236915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:49.196604Z","title":"Calvin: A benchmark for language- conditioned policy learning for long-horizon robot manip- ulation tasks","venue":null,"work_id":"33709821-3cc3-4905-ab17-4d3561d95b2b","year":2022},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:41.292412Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:98715d11acbab40d0891677fb8e3745df48464445e81af5934475dba5008acfc","observation_id":"a3bcff94-6a78-43d9-9dba-0aea345740ba","resolution":{"observed_at":"2026-08-06T19:47:49.277646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:49.039654Z","title":"The deep latent space particle filter for real-time data assimilation with uncertainty quantification","venue":null,"work_id":"50a89632-3a44-4416-96da-33c95b8f22e2","year":2024},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:41.337357Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:1e2345b9ba65c63c185d1ea07947105420d023a390d128347fa3aaaec80d0f7a","observation_id":"baaa893d-4bfb-4997-956a-a2b1f8e47150","resolution":{"observed_at":"2026-08-06T19:47:49.089889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:48.858404Z","title":null,"venue":null,"work_id":"c45355cb-ef98-4fbe-a9ac-4223881dca3a","year":2022},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:41.384122Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:183678895f42cba98a1264c5d9d011cedec2e5fa562eb3aa21ab3ba0e824ec42","observation_id":"bb729636-72e8-4237-8032-cbae885bfbfc","resolution":{"observed_at":"2026-08-06T19:47:48.903738Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:48.688810Z","title":"A real-to-sim-to-real approach to robotic manip- ulation with VLM-generated iterative keypoint rewards","venue":null,"work_id":"d7c87bf8-58f1-43c0-b140-c555a1966cb6","year":2024},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:41.447612Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:2e21bb359bab79fff4d5b6a5f71a8245ad6d1d159f2b4065582f3ef292724cd1","observation_id":"ef9ca880-c2e3-4d85-9b2c-7aed41380125","resolution":{"observed_at":"2026-08-06T19:47:48.721460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:48.505780Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"bd3767b0-8b0c-4cb6-a472-b6668144388a","year":2021},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:41.501344Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:2595cd572bc76b11b31c0ef4d2e0d5ead3e02d045b2089bd6b424fc97cf485b6","observation_id":"99187c9c-c470-45b2-b0aa-b6df514ad934","resolution":{"observed_at":"2026-08-06T19:47:48.543814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T19:47:41.565323Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:41.565323Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:c23b8bc5b6c50c11ca209e826efe74f3e2b4ea31bf24d62bc683642c3db6e7ac","observation_id":"f1662e6a-7c88-47f7-b24c-85f183ef3f94","resolution":{"observed_at":"2026-08-06T19:47:41.565323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:48.310783Z","title":"Vision-language models are zero- shot reward models for reinforcement learning","venue":null,"work_id":"ab349740-0a3a-4220-8212-2a593394a95a","year":2024},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:41.604704Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:257d8ef93d296bc2b30cf2859f1f529848e5dfd0282c380c5160302e7e223c44","observation_id":"23706177-03b2-4fbf-8698-4cba3fcd5a9d","resolution":{"observed_at":"2026-08-06T19:47:48.405348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:48.098934Z","title":"Chinchali","venue":null,"work_id":"68ea4158-d495-415b-adcc-a6979f9e1554","year":null},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:41.664896Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:3fb3d856dbced6ed6ddd260b97a20bd30e3133dab92b8e7e66aac07fa862029a","observation_id":"b25714cc-0c6e-47d5-8b07-a3043dcb36dd","resolution":{"observed_at":"2026-08-06T19:47:48.164013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:47.885437Z","title":"Cliport: What and where pathways for robotic manipulation","venue":null,"work_id":"4220ed86-7096-4c20-8f9a-f38ef4e0fb29","year":2022},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:41.728121Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:cd1ba5af75cfa0a613e1da25a64ea997b22ea39271134c423c8bd9adc02bbe20","observation_id":"10d0986b-78cb-4f54-971c-ac9ea122b65e","resolution":{"observed_at":"2026-08-06T19:47:47.942743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:47.633604Z","title":"Perceiver- actor: A multi-task transformer for robotic manipulation","venue":null,"work_id":"e5eab06f-00c6-4df6-ab95-abdde03ee763","year":2023},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:41.817923Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:847d9a2149090bc0c80e61d67a4953b41c55409cd4f13f8e3ae32c0aa3c0b423","observation_id":"b1f21a69-874f-41b1-b189-c8ff53451e41","resolution":{"observed_at":"2026-08-06T19:47:47.735982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:47.476387Z","title":"Progprompt: Generating situ- ated robot task plans using large language models","venue":null,"work_id":"96c3cd6b-46c1-4da4-92de-1002c161ffd3","year":2023},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:41.891782Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:3c028694c9a1a6aef6c7ed1eba20fa835eb2badf6ebb6daa3241041ea9e41b23","observation_id":"b4c1f25f-8f94-4208-8291-1bdc5dcf0673","resolution":{"observed_at":"2026-08-06T19:47:47.543615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:41.937872Z","title":"Reason-rft: Reinforcement fine-tuning for visual reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:41.937872Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:1f6e1a3fe9fbeae7484f997efdf7058b12e039d2213483013c84cf9d85891d64","observation_id":"c54b97b5-9066-497b-999e-157c0dd7a806","resolution":{"observed_at":"2026-08-06T19:47:41.937872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:47.254722Z","title":"Cotdet: Affordance knowledge prompting for task driven object de- tection","venue":null,"work_id":"70b35642-a78e-46d3-9838-f1b997df92e9","year":2023},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:41.990751Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:198bc88d2cd32a1b183210695a4ccd8d9c4c951adda7c369912508085fadf367","observation_id":"38d4dd40-061d-4311-b806-f3d669eca342","resolution":{"observed_at":"2026-08-06T19:47:47.390815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00778","last_updated":"2025-03-02T08:04:44Z","snapshot_observed_at":"2026-08-07T17:36:17.192706Z","submitted_at":"2025-03-02T08:04:44Z","title":"AffordGrasp: In-Context Affordance Reasoning for Open-Vocabulary Task-Oriented Grasping in Clutter","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00778","snapshot_observed_at":"2026-08-06T19:47:42.042018Z","title":"Affordgrasp: In-context affordance reasoning for open-vocabulary task-oriented grasping in clutter","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:42.042018Z"},"links":{"cited_paper":"/paper/2503.00778","citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:031c56ac469008a9d9f68e226a6e08d2343f63c00995264efe48829516316fac","observation_id":"97be814c-a937-4040-b3cd-c67d0f46dc28","resolution":{"observed_at":"2026-08-06T19:47:42.042018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05273","last_updated":"2025-08-06T10:50:54Z","snapshot_observed_at":"2026-07-06T19:47:12.646290Z","submitted_at":"2024-11-08T02:12:34Z","title":"Real-World Offline Reinforcement Learning from Vision Language Model Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05273","snapshot_observed_at":"2026-08-06T19:47:42.135720Z","title":"Real-world offline reinforce- ment learning from vision language model feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:42.135720Z"},"links":{"cited_paper":"/paper/2411.05273","citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:628d7033cb8a19585dfc9fa1f233850581155b4690cac2a59f293bd79c9ef4da","observation_id":"54bc3c62-7248-4cab-8587-cf1fc9edbe6f","resolution":{"observed_at":"2026-08-06T19:47:42.135720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:47.059414Z","title":"Code as reward: Empowering reinforcement learning with vlms","venue":null,"work_id":"8150fae3-9358-4c03-9b08-ebc48c30e4d3","year":2024},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:42.250922Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:97513ca14ff5cbf1331fbf9ec820e059ee75f42bf179909b7dd7ac2ef35eefb9","observation_id":"27fd4f0c-f04d-427c-98df-383ab589ccce","resolution":{"observed_at":"2026-08-06T19:47:47.174138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T19:47:42.366889Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:42.366889Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:83c0c292f629aad574b1dfb17a94888b265a80538493f5c4709984ea809e7fee","observation_id":"bf4a0aaf-3f49-4f04-8f85-551259fb6f6f","resolution":{"observed_at":"2026-08-06T19:47:42.366889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:46.857459Z","title":"Rl-vlm-f: Rein- forcement learning from vision language foundation model feedback","venue":null,"work_id":"7141f027-bc24-419c-9ea5-7e60f92601a7","year":2024},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:42.528976Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:af6f0d12ca33234c1c599ca540abab8702fd55490d175fcf509a1867a887b490","observation_id":"20d27e66-116d-4cbc-85aa-aea9cdc545fd","resolution":{"observed_at":"2026-08-06T19:47:46.922946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00025","last_updated":"2024-07-12T12:51:00Z","snapshot_observed_at":"2026-07-06T17:09:59.848387Z","submitted_at":"2023-12-28T23:34:43Z","title":"Any-point Trajectory Modeling for Policy Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00025","snapshot_observed_at":"2026-08-06T19:47:42.614493Z","title":"Any-point trajectory modeling for policy learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:42.614493Z"},"links":{"cited_paper":"/paper/2401.00025","citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:5dde9c09d580a91b411924492f3383ca9b1f1f386f56a0e8b8d2232a7d60de23","observation_id":"fb08866f-8e6e-4dcc-a15c-23a99cda2ebb","resolution":{"observed_at":"2026-08-06T19:47:42.614493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13877","last_updated":"2025-05-27T01:46:53Z","snapshot_observed_at":"2026-07-06T20:09:14.917734Z","submitted_at":"2024-12-18T14:17:16Z","title":"RoboMIND: Benchmark on Multi-embodiment Intelligence Normative Data for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13877","snapshot_observed_at":"2026-08-06T19:47:42.681720Z","title":"Robomind: Benchmark on multi- embodiment intelligence normative data for robot manipula- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:42.681720Z"},"links":{"cited_paper":"/paper/2412.13877","citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:c5fe4465d0e900dc0c3a81120805d4aa7b264a41aa7c3ec4e8f431fb12360549","observation_id":"7dce3e65-a42f-40f7-8ed2-0869618216e2","resolution":{"observed_at":"2026-08-06T19:47:42.681720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-06T19:47:42.750529Z","title":"Set-of-mark prompting unleashes extraordinary visual grounding in gpt-4v","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:42.750529Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:1f002af5a0f36c063be0be7af4436516b6abdc807641cff61c0b1e5c5dce722a","observation_id":"63959c63-c49c-4b44-90e8-5d05e92514a1","resolution":{"observed_at":"2026-08-06T19:47:42.750529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:46.679071Z","title":"Robot fine- tuning made easy: Pre-training rewards and policies for au- tonomous real-world reinforcement learning","venue":null,"work_id":"59f67bfe-b380-4d16-b637-89e7c29568b4","year":2024},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:42.851403Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:a81bab4cace42fb4f0c5bfaeb904bf6249465d036ee0f16a95fa8d2c81ac37b8","observation_id":"7d982682-9648-4ece-baef-88452c82b263","resolution":{"observed_at":"2026-08-06T19:47:46.783281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:46.472166Z","title":"Par- ticle filters in latent space for robust deformable linear ob- ject tracking","venue":null,"work_id":"bd5a93f0-ccd4-4938-8807-281ef22fc9ac","year":2022},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:42.923587Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:c2738dc7f93e4769dfbc9158b6b610db23f417dd02a0f7a297de356aa0113a98","observation_id":"e2bb6c5d-f225-4e7b-806a-51239a3d6acf","resolution":{"observed_at":"2026-08-06T19:47:46.603324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:46.235706Z","title":"Sornet: Spatial object-centric representations for se- quential manipulation","venue":null,"work_id":"163b67cc-2355-45c0-9f45-eefb8b434f0b","year":2022},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:42.987023Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:c71939aac207236528bb89f2a053a214e209de5ae2815001bcd3584cfd28c8ea","observation_id":"4f28e9b1-6896-45fa-8085-92ec2fb70bd8","resolution":{"observed_at":"2026-08-06T19:47:46.378775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:46.105698Z","title":"Robopoint: A vision-language model for spatial affordance prediction in robotics","venue":null,"work_id":"808fb5f3-c6ac-47a3-b304-06fa238a1bb5","year":2024},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:43.078554Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:5276a279ca438d3e9d7d28a07245a2f7be7ba8fbc34634d69c4e00ef2f1e2a5b","observation_id":"218006e5-280a-4e00-837c-38e8e384aa60","resolution":{"observed_at":"2026-08-06T19:47:46.158520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:45.936535Z","title":"Sam-e: Leveraging visual foundation model with sequence imitation for embodied ma- nipulation","venue":null,"work_id":"1af435ec-af4f-4704-93b8-6ddb66326bf9","year":2024},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:43.151441Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:987ab4126a3a7013901114c95e92dd066be106909354ada94d9c567dc8b64276","observation_id":"c571f2e5-095b-4f16-bfaf-fea0bb00de83","resolution":{"observed_at":"2026-08-06T19:47:46.014193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13451","last_updated":"2026-05-09T11:40:06Z","snapshot_observed_at":"2026-08-02T06:35:33.765328Z","submitted_at":"2025-02-19T05:52:34Z","title":"MapNav: A Novel Memory Representation via Annotated Semantic Maps for Vision-and-Language Navigation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13451","snapshot_observed_at":"2026-08-06T19:47:43.218177Z","title":"Mapnav: A novel memory representation via annotated semantic maps for vlm-based vision-and-language navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:43.218177Z"},"links":{"cited_paper":"/paper/2502.13451","citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:8ea7ff271d9c97d134d7bf3c9a1ffd5adac9286afa2e0a7925dad2610d588e3e","observation_id":"429af5d3-1448-4a2c-a090-499261c9dcb6","resolution":{"observed_at":"2026-08-06T19:47:43.218177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10345","last_updated":"2025-06-05T21:26:08Z","snapshot_observed_at":"2026-08-02T17:44:41.340688Z","submitted_at":"2024-12-13T18:40:51Z","title":"TraceVLA: Visual Trace Prompting Enhances Spatial-Temporal Awareness for Generalist Robotic Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10345","snapshot_observed_at":"2026-08-06T19:47:43.290054Z","title":"// ac0on Visual embeddingsGripper statesBounding boxes//Stop gradientsFailure Actor #","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:43.290054Z"},"links":{"cited_paper":"/paper/2412.10345","citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:357495ac5b0a19e2605e004ee13a5d1be973530c392ff9951f3a8841e66c5dd3","observation_id":"e2bde3eb-7b89-43d8-ac34-52fb8082f21b","resolution":{"observed_at":"2026-08-06T19:47:43.290054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:45.696118Z","title":null,"venue":null,"work_id":"3c490791-7bfb-4b41-b0b7-e65cc30fb2f4","year":null},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:43.353180Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:df7bb9b0dfb1f70ba5b3ff6bce84bba4051260b32e0db108bda214dfb30a4928","observation_id":"e9e5d94c-0ddc-42ff-9e4a-a575fa5fcfce","resolution":{"observed_at":"2026-08-06T19:47:45.846680Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:45.223530Z","title":null,"venue":null,"work_id":"6be31b73-14ef-42d9-9d71-854e5d8cbac1","year":null},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:43.546848Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:0cc4601a5093e0ab91bd9488632f54fd9b786058e5aa80664ada11f1503bf599","observation_id":"6a8e0e12-be39-4bf6-86ce-c1690d17dbb5","resolution":{"observed_at":"2026-08-06T19:47:45.286813Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:45.023805Z","title":"Figure 11","venue":null,"work_id":"e74b0cab-eb15-4b6c-8e05-26f29853ab66","year":null},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:43.639443Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:1e20ea289ad8862c822f71ff761fb25f6d1ab29ce0291223f6d2e204f770d9d2","observation_id":"95211ab0-e2b3-4a49-8da8-7f736371a782","resolution":{"observed_at":"2026-08-06T19:47:45.081039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:44.748637Z","title":null,"venue":null,"work_id":"7ad81800-4ab6-415f-add7-fa0f4c356847","year":null},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:43.723254Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:8dd2a9701a4d36d4e706812e7de6f783c11368b59202a6d78538ee0616958033","observation_id":"a9656fe6-cc2f-4b2f-bdfb-2fb0cc0ead1c","resolution":{"observed_at":"2026-08-06T19:47:44.831500Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:45.375439Z","title":null,"venue":null,"work_id":"fb6cf0e6-c0e3-4195-84ac-ee848ae4d2f8","year":null},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:43.790046Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:abc3572f06054a6cd3c96dc9b5de387628aea9247d2cb8eb754a98a3520fafc1","observation_id":"d2b99751-8743-4fa9-a03e-4a64aaf32e54","resolution":{"observed_at":"2026-08-06T19:47:45.446685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:45.528023Z","title":null,"venue":null,"work_id":"20b99143-71f8-44e1-b4f5-8e6b3813ef34","year":null},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:43.909897Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:6e0cd0d5c27a157111d26da9b36e9a26f760c845b4adcab89d9e8cf18023cbbd","observation_id":"db95df95-ace1-4a26-899d-51c16c8dae9c","resolution":{"observed_at":"2026-08-06T19:47:45.620439Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:47:44.548982Z","title":"Completion Status Identification of Sub-goals: System prompt: Detailed in Fig","venue":null,"work_id":"8378a43f-7e50-4a76-8505-65176af734e1","year":null},"citing_paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T19:47:44.014826Z"},"links":{"citing_paper":"/paper/2507.04789"},"observation_digest":"sha256:5772977f5c14d65f6de859a5c99430160207e9a700566fdf39781dd22b30716d","observation_id":"4fe6474c-0e82-4c38-a003-dcb777e0049d","resolution":{"observed_at":"2026-08-06T19:47:44.614948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04789","last_updated":"2025-07-07T09:11:08Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T11:46:22.084000Z","submitted_at":"2025-07-07T09:11:08Z","title":"Training-free Generation of Temporally Consistent Rewards from VLMs"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2507.04789."}