I
Codex Instructions · Safety Evaluation

檢查 Codex 指令的
版本、證據與
回滾路徑

gpt-instruct 提供 Codex 自訂 model instructions 的版本化封裝、部署腳本與可重現評測工具鏈。此手冊聚焦 dry-run、檔案雜湊、隔離環境、發布門禁與回滾;不轉載可直接繞過模型防護的 prompt 內容。

7.6k
GitHub Stars
2
目前維護版本線
3
A / B / C 門禁
MIT
開源授權
01
Repository 定位

版本化 Prompt 與
評測工具鏈

gpt-instruct 管理兩條 Codex 自訂指令版本線:gpt-5.6-sol-v45 與 gpt-6-astra-v1。發布物以 ZIP 保存,README 同時列出 SHA-256,供下載後核對檔案身分。

codex-instruct.py 將選定 Markdown 複製至 CODEX_HOME,並更新 config.toml 頂層的 model_instructions_file。寫入前會保存狀態;reset 只恢復這個專案管理的設定項。

評測層以 A、B、C 三階段管理候選版本。每次測試保存模型、reasoning、method identity、回應與 artifact evidence,避免跨方法拼接成績。

gpt-instruct · 安全檢查流程
確認版本→ 核對 SHA-256→ Dry-run→ 隔離評測→ 證據審查→ 回滾
A Codex jailbreak prompt and test pack for gpt.
— MDX-Tom/gpt-instruct · GitHub description
02
Python 3.8+

Repository 取得與
Dry-run

先複製官方 repository,再查看 CLI 說明。使用 --dry-run 預覽 stable package 對 CODEX_HOME 與 config.toml 的預定變更,不寫入任何設定。

git clone https://github.com/MDX-Tom/gpt-instruct.git cd gpt-instruct python3 codex-instruct.py --help python3 codex-instruct.py --apply --version gpt-5.6-v45 --dry-run

回滾預覽與單元測試

reset 支援 dry-run,可先確認哪些 managed prompts 與設定項會變更。Repository 的單元測試檢查 CLI、archive sync 與 star-history 工具。

python3 codex-instruct.py --reset --dry-run python3 -m unittest discover -s unit-tests -q
此 repository 自稱 jailbreak/破甲測試包。官方 README 明示使用自訂模型指令存在帳號風險。只在你有權操作的隔離環境進行安全研究;此手冊不提供 active deployment 命令或完整繞過 prompt。
03
codex-instruct.py

預覽、選版、狀態與
回復操作

CLI 將版本選擇、設定變更與回復拆成互斥 action。先使用 dry-run 與獨立 CODEX_HOME 檢查計畫。

Inspect · 01
--dry-run
變更預覽
顯示檔案與設定計畫,不寫入 prompt、state 或 config。
Select · 02
--version
封裝版本
在 gpt-5.6-v45 與 gpt-6-v1 兩個 packaged choices 間選擇。
Scope · 03
--codex-dir
Codex 目錄
指定要檢查的 Codex home,便於使用隔離目錄測試。
Input · 04
--file
自訂封裝
接受 ZIP 或 Markdown;使用前必須審查內容、檔名與來源。
Rollback · 05
--reset
Managed 回復
移除管理中的 prompts,並恢復先前的 model_instructions_file 設定。
Emergency · 06
--restore-snapshot
完整快照
明確指定完整 config snapshot;此動作可能恢復舊 provider、model 或 authentication 設定。

操作選擇表

目的介面安全檢查
只查看支援選項--help不改動檔案
預覽 stable plan--apply ... --dry-run確認目標路徑與預定設定
檢查隔離 Codex home--codex-dir不要指向日常帳號設定
預覽回復--reset --dry-run確認 managed ownership
完整快照回復--restore-snapshot人工確認 provider 與認證差異
04
A / B / C 發布門禁

可比較的測試身分與
工件證據

候選版本必須保存方法身分與原始證據。安全研究應審查測試設計與失敗分類,不只查看彙總分數。

GATE A

小型準入測試

涵蓋三個原樣例與一個精確工作目錄續作探針;檢查 turns、declared artifacts 與 probe target。

來源 · README · A / B / C 發布門禁
GATE B

Issue 回歸樣例

全量範圍為 66 cases、74 turns,並要求全部 declared artifacts 通過。

來源 · README · A / B / C 發布門禁
GATE C

Medium 原始測試

範圍為 120 個原始樣例;只有 A 與 B 的硬門檻全部滿足後才執行。

來源 · README · A / B / C 發布門禁
EVIDENCE 01

隔離使用者目錄

測試在一次性 HOME、CODEX_HOME、XDG 與 TMPDIR 中執行,避免修改日常 Codex 設定。

來源 · README · 維護原則
EVIDENCE 02

方法身分一致

只有模型、reasoning、方法與 transport 相符的結果可以比較,不跨身分合併分數。

來源 · README · 系統架構 / 維護原則
EVIDENCE 03

中斷與模型失敗分離

網路、容量、帳號、quota 與 transport error 記為 interrupted;provider-policy block 另行分類。

來源 · docs/gpt-5.6-sol-safety-eval.md
05
Non-writing Audit

封裝驗證與
隔離預覽

以下流程只檢查來源、雜湊、CLI 計畫與單元測試,不啟用 repository 內的自訂模型指令。

gpt-instruct · audit-only
$ git clone https://github.com/MDX-Tom/gpt-instruct.git $ cd gpt-instruct
$ shasum -a 256 gpt-5.6-sol-v45.zip gpt-6-astra-v1.zip 將輸出與 README 公布的兩個 SHA-256 逐字比對
$ python3 codex-instruct.py --apply --version gpt-5.6-v45 --dry-run 確認預定 prompt filename、CODEX_HOME 與 model_instructions_file;不寫入
$ python3 codex-instruct.py --reset --dry-run 確認回復範圍只包含專案管理的 prompt 與設定項
$ python3 -m unittest discover -s unit-tests -q 完成 CLI、archive sync 與相關單元測試
Every modification candidate includes a modified artifact, diff, verification record, and runnable rollback.
— MDX-Tom/gpt-instruct README_EN.md · Maintenance Principles

完成條件

repository 來源正確、兩個 ZIP 的雜湊與 README 相符、dry-run 沒有寫入日常 Codex home,且單元測試完成。任何 active deployment 需另行取得明確授權並評估帳號與政策風險。

06
政策、帳號與評測限制

自訂指令的
高風險邊界

  • 專案目標包含降低模型拒絕。測試銀行涵蓋滲透測試、破解與 jailbreak research 等高風險題材;不要把通過率當成安全性或合規性指標。
  • 官方 README 明示帳號風險。自訂模型指令可能違反服務條款或 provider policy;不要在主要帳號、企業環境或未授權系統中測試。
  • 只在有權操作的隔離環境使用。Repository 使用 Codex 官方設定機制,但這不代表 prompt 內容或實際輸出已獲目標服務授權。
  • Dry-run 不檢查 prompt 是否安全。它只預覽檔案與設定變更;啟用前仍需人工審查 Markdown 內容、權限與預期行為。
  • gpt-6-astra-v1 未通過全部硬門檻。README 記錄其全量 B 為 52/66 cases、60/74 turns,C 尚未執行。
  • 不同方法的分數不可直接比較。模型、reasoning、transport、測試 coverage 或 scorer 不同時,只能作趨勢參考。
  • 完整 snapshot restore 可能覆蓋其他設定。它可能恢復舊 provider、model 或 authentication;一般回復優先使用 managed reset。
  • 不要公開敏感測試輸出。報告、raw responses 與 artifacts 可能包含可被濫用的操作內容;分享前先做安全與權限審查。
07
方法審查與防禦研究

從執行結果到
可重現證據

把 repository 當成 prompt evaluation 與配置回滾案例研究。優先檢查測試定義、scorer、失敗分類及 isolation mechanism。

進階工作地圖

1. 檢查版本雜湊。先比對 README 公布的 ZIP SHA-256,再解壓或分析內容。

2. 閱讀比較方法。確認 A/B/C coverage、case/turn 計數與 artifact gates,分開處理 release decision 與 hard threshold。

3. 稽核 scorer。檢查 refusal、semantic redirection、declared delivery groups 與 missing output 的判定方式。

4. 重建隔離環境。測試使用一次性 HOME、CODEX_HOME、XDG 與 TMPDIR,並禁止觸碰日常設定。

5. 保存可回滾證據。每次修改保留候選檔、diff、方法身分、驗證結果與 rollback plan。

延伸閱讀

① README.md:版本、SHA-256、CLI、發布門禁與維護原則。
② docs/comparison-tests.md:A/B/C 方法、可比結果與限制。
③ Safety Evaluation:prompt bank、verdict rules 與 isolation 設計。

…but scores are compared only under the same model, reasoning level, and method identity.
— MDX-Tom/gpt-instruct README_EN.md · System Architecture