목록전체 글 (631)
꿈 많은 사람의 이야기
포스팅 개요본 포스팅은 클로드 코드(Claude Code)의 원격 제어(Remote Control, rc) 기능에 대해 다루는 글입니다.Claude Code를 사용하다 보면 시간이 오래 걸리는 작업을 실행해두고 자리를 비우거나, 다른 PC에서 진행 상황을 확인하고 싶은 경우가 있습니다. 기존에는 Claude Code를 실행한 터미널이 있는 PC로 돌아가야 했지만, Remote Control을 사용하면 현재 PC에서 실행 중인 Claude Code 세션을 브라우저나 스마트폰에서 그대로 이어서 사용할 수 있습니다.중요한 점은 Claude Code가 다른 기기에서 실행되는 것이 아니라는 것입니다. Claude Code 프로세스와 코드 실행, 로컬 파일 접근, MCP 서버 등은 기존 PC에서 그대로 동작하고, ..
포스팅 개요2026년 9월 3일, OpenAI가 GPT-6 Astra를 공개했습니다. 새로운 GPT 모델이 나올 때마다 자연스럽게 가장 먼저 보게 되는 것은 벤치마크입니다. 수학 문제를 얼마나 더 잘 풀었는지, 코딩 성능은 얼마나 좋아졌는지, 이전 모델보다 몇 퍼센트 향상되었는지를 보는 것이죠.GPT-6 Astra도 당연히 여러 벤치마크에서 큰 성능 향상이 있습니다. FrontierMath Tier 4에서는 97.6%, ARC-AGI-3에서는 99.9%, ExploitBench에서는 100%를 기록했습니다. 특히 일부 결과는 GPT-5.6 Sol과 비교했을 때 굉장히 큰 차이를 보여줍니다.그런데 이번 GPT-6 발표 자료를 쭉 살펴보면서 개인적으로 더 흥미롭게 본 것은 단순한 점수 상승이 아니었습니다.O..
포스팅 개요본 포스팅은 제 티스토리 블로그에 발생한 대규모 댓글 도배를 정리하기 위해 직접 만든 댓글 관리/삭제 서비스를 소개하는 포스팅입니다.2026년 8월 8일 저녁, 갑자기 댓글 알림이 비정상적으로 많이 들어와 있는 것을 확인했습니다. 처음에는 흔한 스팸 댓글이라고 생각했는데요. 알람이 계속 울려서 실제로 확인해보니 약 4시간 동안 여러 게시글에 수천 건의 댓글이 등록되어 있었습니다.나중에 직접 만든 도구로 전체 댓글을 다시 수집해보니 피해 게시글은 총 13개, 그중 5,571건이 도배 댓글이었습니다.특히 댓글의 닉네임에는 SQL Injection 취약점을 확인할 때 사용하는 문자열이 포함되어 있었습니다. 특정 글에 악플을 남기는 형태라기보다 자동화된 취약점 탐색 도구가 티스토리 댓글 입력창을 대상..
포스팅 개요RAG(Retrieval Augmented Generation) 시스템이나 AI Agent를 개발하다 보면 결국 데이터에 대한 고민을 하게 됩니다.어떤 LLM을 사용할지, 어떤 Vector Database를 사용할지와 같은 부분도 중요하지만 그 전에 먼저 해결해야 하는 것이 있습니다. 바로 우리가 가지고 있는 문서를 LLM이 활용할 수 있는 데이터로 만드는 것입니다.특히 회사에서 RAG나 AI Agent 시스템을 만들다 보면 PDF뿐만 아니라 HWP, HWPX, Word 등 여러 형태의 문서를 사용하게 됩니다.보고서, 매뉴얼, 공고문, 연구 자료처럼 이미 회사에 쌓여 있는 문서가 굉장히 많기 때문인데요. 문제는 이러한 문서를 단순히 텍스트로만 추출해서 사용할 수 없다는 점입니다.예를 들어 문서..
포스팅 개요예전 회사에서는 Confluence Jira로 일했습니다. 티켓을 끊고, 보드에서 카드를 옮기고, 스프린트를 닫는 흐름이 몸에 배어 있었죠. 일정이 밀리면 밀린 대로 보드에 그대로 드러나니까 굳이 따로 정리하지 않아도 상황이 공유되는 게 편했습니다. 그렇게 파트를 관리하고, 팀 전체 일정 관리하고, 제 일정 관리하고 했었습니다.그런데 작년, 이직을 하고 나서 상황이 조금 달라졌습니다. 지금 회사는 보안 정책상 외부 SaaS를 쓸 수 없습니다. 인터넷과 분리된 폐쇄망 안에서 도는 서비스만 사용할 수 있으니 Jira도 Notion 등 사용할 수가 없었죠. 어쩔 수 없이 입사 초반에는 엑셀로 WBS를 관리하게 되었는데, 가면 갈수록 너무 불편했습니다. 파일이 여기저기 돌아다니니 어느 게 최신본인지 ..
Anthropic이 Claude Opus 5를 공개했습니다. 좋은 성능을 싼값에 쓸 수 있게 만든 모델이라는 특징이 두드러집니다.그리고 같은 날 올라온 글이 하나 더 있습니다. Anthropic 기술 스태프 Thariq Shihipar가 쓴 "The new rules of context engineering for Claude 5 generation models"인데요. 이 글에서는 Opus 5와 Fable 5 같은 모델을 위해 Claude Code 시스템 프롬프트의 80퍼센트 이상을 제거했고 자사 코딩 평가에서 측정 가능한 손실이 없었다는 겁니다. 벤치마크 차트보다 이쪽이 실무자에게 더 중요할 것 같고 저도 이 글을 좀 더 관심있게 봤습니다. 클로드 모델 중 Opus 5의 라인업 앤트로픽의 클로드 모..
이 논문은 제목부터가 좀 놀랍다. "왜 모든 LLM은 일본 문화에 집착하는가"라는 물음은 이 논문이 실제로 발견한 현상을 그대로 옮긴 것이다. 지금까지 언어모델의 문화 편향을 다룬 연구들은 대체로 "LLM은 서구, 특히 미국과 유럽 쪽으로 기운다"는 결론을 반복해 왔다. 그런데 이 논문은 지역 정보를 일부러 지운 상태에서 모델에게 문화 질문을 던지고 스스로 장소를 고르게 했더니, 여덟 개의 최신 모델 대부분이 미국보다 오히려 일본을 가장 자주 떠올린다는 사실을 확인했다. 기존 통념을 정면으로 뒤집는 결과다.저자들은 여기서 멈추지 않고 두 가지를 더 파고든다. 하나는 입력 언어가 이 편향을 어떻게 바꾸는지, 다른 하나는 이 편향이 모델 학습의 어느 단계에서 생겨나는지다. 결론부터 말하면, 편향은 사전학습(..
포스팅 개요본 포스팅은 AI 에이전트 상호운용(interoperability) 프로토콜을 다룬 논문 Governance Gaps in Agent Interoperability Protocols: What MCP, A2A, and ACP Cannot Express를 리뷰한 글입니다. 2026년 6월에 공개된 논문(arXiv:2606.31498)으로, 요즘 부쩍 자주 들리는 다섯 개의 에이전트 프로토콜인 MCP, A2A, ACP, ANP, ERC-8004을 하나하나 뜯어보면서 "이 프로토콜들이 과연 에이전트 공동체의 거버넌스를 담을 수 있는가"를 체계적으로 따진 연구입니다.그런데 제목을 보고 "또 프로토콜 비교 논문이겠거니" 하고 넘기기엔 조금 관점이 다릅니다. 이 논문에서는 "우리는 AI 에이전트에게 일하..
포스팅 개요이번 포스팅은 2026년 6월에 일어난 Claude Fable 5와 Mythos 5 차단 사건을 정리하는 글입니다. 앤트로픽(Anthropic)이 보안에 특화된 모델 두 개를 6월 9일에 공개했고, 사흘 뒤인 6월 12일에 미국 상무부의 지시로 두 모델이 전 세계에서 막혔습니다. 출시한 회사가 안전을 이유로 잠가 뒀던 모델에 안전장치를 달아 일반에 풀었는데, 사흘 만에 정부가 안보를 이유로 다시 잠근 셈입니다.단순한 출시 해프닝으로 끝날 일이 아닙니다. 강력한 AI 모델이 처음으로 미국 수출 통제의 대상이 됐고, 그 명단에는 KISA, SK텔레콤, 삼성전자, SK하이닉스 같은 한국 기관과 기업의 이름이 올라 있었기 때문입니다. 이 글은 그 사흘 동안 정확히 무슨 일이 있었는지, 그리고 6월 2..
포스팅 개요작년까지만 해도 AI 안전성(Safety)을 이야기할 때 "이 모델이 폭탄 제조법을 알려주느냐", "이 모델이 차별 발언을 하느냐" 같은 단일 응답의 위험에 대한 이야기가 많았었습니다. 모델은 입력에 답하는 함수였고, 평가는 그 답이 얼마나 위험한가에 초점을 맞췄던 것이죠.1년이 더 지난 지금, 무게중심이 옮겨간 것 같습니다. 이제는 우리가 걱정해야 하는 건 모델이 무슨 말을 하느냐가 아니라, 모델이 도구를 들고 무엇을 하느냐인 것 같습니다. 코드를 실행하고, 파일을 읽고, 메일을 보내고, 다른 에이전트와 협업하는 AI Agent 시스템의 시대이기 때문이죠. 그리고 이 에이전트들이 본격적으로 실서비스에 들어가기 시작하면서, 챗봇 시대의 안전 평가 방식이 더 이상 통하지 않는다는 이야기가 점점 ..