用 Codex 跑通跨境电商的日常运营,先搞懂它的沙箱
Codex 和聊天工具的区别在于它能真的动你的文件和命令,所以它把安全边界做在了操作系统层:默认只能写当前工作区,网络默认是关的,越界要审批。这一层不先搞懂,后面所有场景要么跑不通,要么放得太开。业务规则写在 AGENTS.md,权限和模型写在 config.toml,两者分工清楚,重复的活才能稳定交出去。判断一件事该不该交给它,看重复频率、规则能不能写出来、结果能不能验证。
Codex 能干的事和一般聊天工具不是一个量级:它读你本地的表格和文档、写文件、跑命令,跑完给你一份能直接用的东西,而不是一段建议。
但正因为它真的会动手,OpenAI 把安全边界做在了操作系统层,而不是靠提示词约束。这带来两个默认设定,跨境场景里第一天就会撞上:
很多人第一次用 Codex 觉得「它怎么什么都做不了」,原因基本都在这两条上。反过来,也有人图省事直接开全权限,那等于把整台机器交出去。
所以这篇先讲清楚它到底能做什么、边界在哪,再讲怎么用到跨境运营里。顺序反了,后面每一步都会别扭。
抽象讲没用,看三件跨境团队每周都在做的事。
问聊天工具:广告数据怎么分析。
它会给你一套很像样的框架:先看整体 ACoS,再看各广告活动的贡献,找出高花费低转化的词,考虑加否定词。方法是对的,但你还得自己导 CSV、自己筛、自己算、自己写结论。
交给 Codex:把广告报表放进目录,它自己读文件,按你定的口径写一段脚本算指标,找出花费超阈值但订单为零的词,把否定词候选和诊断报告写成一个新文件。
你打开的是一份写好的报告,不是一段方法论。
问聊天工具:帮我写一段 Listing。
它给你一段文案,写得不差,但它不知道你的产品参数、不知道竞品在写什么、不知道你要投哪几个站点。
交给 Codex:把产品参数、竞品 Listing 和关键词数据放进目录,它综合这些材料生成标题、五点描述和产品描述,还能一次生成多个站点的版本,输出成能直接往后台贴的文件。
差别不在文笔,在它手上有没有材料。
问聊天工具:补货怎么算。
它给你一个安全库存公式。公式没错,但你要自己查 90 天销量、自己查在途、自己套公式、自己做表。
交给 Codex:读销量导出和库存表,按你定的备货周期和安全库存规则算,直接生成一份补货建议表,把有断货风险的 SKU 排在最前面。
一句话总结:一个输出建议,一个执行工作并交付成果。
把「能干活」拆开,就是这几类动作:
codex exec 跑在脚本或定时任务里,不用人守着codex mcp 管理最后两条是它和聊天工具真正拉开距离的地方。聊天每次都是一次性的,你这周教的口径,下周还得再教一遍;写成规则文件之后,这些东西固定下来了。
这一点必须说在前面,否则很容易失望。
Codex 本身不带任何业务数据。它不知道你的销量、不知道广告花费、不知道库存,也进不去你的卖家后台。
所有数据都要你先给它:从平台后台导出文件放进目录,或者配置 MCP 让它能去取,或者把资料整理好放在它能读到的地方。
所以真正决定效果的,往往不是模型多强,而是你有没有把数据接进来。很多人试用一次觉得「也就那样」,原因通常是全程没给过任何真实数据,等于让它凭空猜。
要把一件事真的交出去,需要四层都到位:
前三层各家工具做法大同小异。Codex 的特点在第四层:它不是靠「你别乱来」这种指令来约束,而是由操作系统限制它能碰什么。
这个区别很实在——**安全边界不会因为提示词写得不好而失效。**即使你在对话里说「你可以改这个文件」,只要沙箱不允许,它也改不了。
第四层由两个正交的开关决定,分开配。
沙箱模式决定它能碰到什么:
| 模式 | 能做什么 |
|---|---|
read-only |
读文件、运行命令,但不能改任何东西 |
workspace-write |
默认值。当前工作区里能读能改能跑,出了工作区要审批 |
danger-full-access |
没有沙箱,能碰整台机器 |
审批策略决定它什么时候停下来问你:
| 策略 | 什么时候问 |
|---|---|
on-request |
默认值。沙箱内的命令自动跑;越界、联网、受限命令要问 |
never |
不弹审批。但沙箱约束仍然生效 |
never 常被误解成「什么都能干」。不是的——它只是不问你,沙箱该拦的还是拦。所以 read-only 加 never 反而是个很安全的组合:不打扰你,也改不了东西,适合放进定时任务。
最常用的两组:
workspace-write + on-request,也就是默认预设read-only + neverdanger-full-access 官方标了高风险,说明写得很直白:没有沙箱、没有审批,恶意项目可以把机器上能拿到的东西都带走,包括凭据。跨境团队的机器上通常有什么?平台登录态、API 密钥、客户数据导出、供应商合同。所以规则很简单:要用全权限,就在容器里用,不要在日常办公机器上直接开。
这一条容易被忽略,但它比任何配置都重要。
沙箱说的「工作区」,就是你启动 Codex 的那个目录。所以这两件事其实是同一件事:
在家目录裸跑 codex,等于把整个家目录设成了可写范围。这不是危言耸听,这是默认行为。
养成习惯:**每类活一个目录,进目录再启动。**顺带还有个好处——目录分开了,数据也是分开的,广告报表不会和客户邮件混在一个工作区里。
跨境运营里有一大类活要联网:抓竞品页面、查关键词、调平台接口、拉汇率。而 Codex 默认不给网络。
打开的方式是在配置里显式声明:
[sandbox_workspace_write]
network_access = true
或者命令行临时开一次:
codex -c 'sandbox_workspace_write.network_access=true'
**建议用后者。**理由是网络一开,风险模型就变了:它现在既能读你的本地文件,又能往外发请求。这两个能力叠加起来,比单独任何一个都危险。
推荐做法:全局保持关闭,只在明确需要联网的那类任务里临时开,做完就没了。
Codex 有两个文件要分清楚。
AGENTS.md 放业务规则:指标口径、报告格式、判断阈值、话术模板、什么情况必须升级处理。它可以放在用户级目录,也可以放在项目里;从仓库根目录往下逐层拼接,越靠近当前目录的越优先。合并后默认上限 32 KiB,超了就不再往下加,所以别写成大杂烩。
在项目里跑一次 /init,它会生成一个骨架,你再按自己的业务改。
config.toml 放工具配置:用哪个模型、推理强度、审批策略、沙箱模式。用户级在 ~/.codex/config.toml,项目级在 .codex/config.toml,项目级优先,但只在你信任该项目时才加载。
分工很清楚:**AGENTS.md 是「按什么标准干活」,config.toml 是「允许它干到什么程度」。**前者是业务资产,该进版本库、团队共享;后者是安全设置。混在一起写迟早出问题。
按需要的沙箱档位分,跨境团队的活正好分三类。这个切分有个好处:你不用每次纠结「这个活安不安全」,看它需要哪一档权限就知道了。
这一档下你几乎不用担心它做错什么——最坏结果是分析得不对,你看一眼就发现了。
配默认档位,但把工作区限定在专门的目录里。工作区越小,边界越清楚。
在 workspace-write 基础上临时开网络,做完这一次就结束,不写进长期配置。
另外,抓取本身要守目标站点的规则:只抓公开可见的内容,控制频率,不绕登录和验证。技术上能抓,不等于抓了没风险。
不是所有活都适合。挑第一件事时按这三条筛:
三条都满足的先做,只满足一两条的往后排。一条都不满足的,说明这件事本来就没标准化,别指望 AI 替你解决管理问题。
反过来,看起来很难但规则清晰的活,往往比看起来简单却全靠经验的活更适合先交出去。
而谈判、供应商关系维护、品牌定位这类依赖长期判断的事,不适合作为主要自动化对象。判断方法很简单:这件事你能不能写出一份别人照着做也能做对的说明书。写得出来的适合交,写不出来的说明依赖的是人的判断。
沙箱管的是「它能碰到什么」,管不了「这个决定对不对」。
它拦不住一份口径算错的报表,拦不住一段有合规风险的文案,拦不住一个不该发给客户的承诺。这些要靠规则和人工确认。
所以下面这些动作,无论沙箱怎么配,都要留人:
正确用法是让它把草稿和依据准备好,最后一步由人点头。技术边界和业务边界是两回事,两个都要有。
这是导入前最容易算错的一笔账。很多人只算订阅费,然后得出「很便宜」或者「不值」,两个方向都容易错。
订阅和模型费通常是整件事里最小的一部分。要一起算进去的还有:
所以判断值不值得,不能只看每月花多少,要看这件事一年重复多少次、每次省多少时间、错误率降了多少。这三个数跑不出来,就说明还没到扩大投入的时候。
不用先规划系统,先做这三步:
AGENTS.md,先用 read-only 跑第四个数最重要。它会告诉你下一个该自动化的是哪一段,以及哪一段永远不该自动化。
按顺序来,每篇都能单独看:
config.toml 怎么写,项目级怎么覆盖用户级AGENTS.md:把运营规则写成它每次都读的文件codex exec 把广告诊断跑成不用人盯的流程如果你手上有一件每周都要重复、规则说得清、结果能验证的活,可以直接把它现在的输入和做法发过来,我们先判断它适不适合交出去。联系方式在关于页面。
大部分团队用 AI 还停在翻译、写文案和生成图,AI 只参与了工作中间一小段。Claude Code 的区别在于它能读本地文件、通过 MCP 接外部数据、把流程写成 Skill 反复执行,也就是能自己动手而不只是给建议。但对外发送、改价、改库存这类动作必须留人工确认;能批量生成不等于该批量生成。建议先挑一个每周都要重复、规则写得出来、结果能验证的动作跑通,再往外扩。
作者
大阪烧鸟
大阪烧鸟,关注 AI 在跨境电商运营中的实际应用、Shopify 独立站与日本商业观察,偏爱把复杂问题拆成可执行的方法。